Google 在 30 日宣布推出全新機器人 AI 模型 Gemini Robotics ER 2,這款模型被視為目前最進步的「具身推理(Embodied Reasoning)」系統,堪稱機器人的「高階大腦」。相較於前一代 Gemini Robotics ER 1.6,新版本在多方面實現了重大突破,包括連續影片理解、任務進度追蹤、工具調度以及多機器人協作能力。
事實陳述
Gemini Robotics ER 2 的最大進步在於其「即時情境感知」能力。過去,機器人多數只能分析單張影像,而新版本則能持續觀看攝影機畫面,即時掌握任務完成進度、判斷執行過程是否出錯、是否需要重新嘗試,以及是否可以進入下一個步驟。例如,它能判斷燈泡是否已鎖緊、垃圾袋是否綁好,或咖啡是否已倒至適當容量,只有在確認任務完成後,才會繼續下一步。
各方反應
Google 表示,Gemini Robotics ER 2 在進度分類任務中的準確率約 57.4%,優於前一代模型。另一項重要升級是關鍵時刻辨識(Moment Finding),新模型在這項測試中的準確率達 91.3%,平均時間誤差僅 0.96 秒。此外,它還加入了多機器人協作功能,允許不同類型的機器人共享語意理解能力,彼此分工、交接任務,共同完成複雜工作流程。
Google 也展示了與波士頓動力(Boston Dynamics)的合作成果,透過 Gemini Robotics ER 2 整合 Spot 四足機器人的導航 API 與機械手臂控制能力,使用者只需以自然語言下達「幫我拿爆米花」等指令,Spot 便能自主導航、尋找目標物並完成取物。
背景補充
Gemini Robotics ER 2 不僅提升了空間理解能力,還涵蓋三大核心功能:成功/失敗偵測、儀器讀值和視覺問答。在成功/失敗偵測方面,新模型可直接分析原始影片串流,即時偵測液體灑出、物品滑落、對位偏移等失敗情況。在儀器讀值方面,已從過去主要支援類比儀表,擴展至可辨識 10 種不同類型的儀器。最後,在視覺問答方面,機器人能更準確理解複雜的視覺資訊,並回答與空間環境相關的問題。
從產業面來看,Gemini Robotics ER 2 的推出,標誌著機器人技術邁向了新的里程碑。不僅在功能上實現了質的飛躍,更在安全性方面做出了顯著改進。對於企業而言,這意味著更高效率的自動化工作流程,以及更靈活的多機器人協作能力。
在安全性方面,Gemini Robotics ER 2 表現優異。當有人靠近機器人時,系統能自動停止作業、持續監測周遭環境,並在確認人員離開後自主恢復工作。Google 同時推出全新的安全評估基準,進一步提升未來具身 AI(Embodied AI)的安全性。
Gemini Robotics ER 2 已通過 Gemini API(可於 Google AI Studio 使用)開放開發者;企業版則以 Private Preview 形式於 Gemini Enterprise Agent Platform 提供。
對於開發者和企業而言,這是一次不容錯過的技術進步。你是否已經準備好迎接這個全新的「高階大腦」時代?
本文改寫整理自公開新聞來源,原始報導由自由時報發布。
常見問題 FAQ
Gemini Robotics ER 2 的主要功能有哪些?
Gemini Robotics ER 2 的主要功能包括連續影片理解、任務進度追蹤、工具調度和多機器人協作能力。
Gemini Robotics ER 2 在哪些方面表現優異?
Gemini Robotics ER 2 在進度分類任務中的準確率約 57.4%,關鍵時刻辨識的準確率達 91.3%,平均時間誤差僅 0.96 秒。
Gemini Robotics ER 2 如何提升安全性?
Gemini Robotics ER 2 在人員接近偵測及安全指令遵循兩項測試中表現優異,當有人靠近機器人時,系統能自動停止作業、持續監測周遭環境,並在確認人員離開後自主恢復工作。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。