Google DeepMind 近日推出全新「具身推理」(embodied reasoning)模型 Gemini Robotics ER 2,旨在突破現有機器人在真實物理世界中的局限。這款模型不僅具備升級的空間與影片理解能力,更主打即時決策與多機器人協作,為實體 AI 的應用開啟全新篇章。
結合直覺與速度的高階大腦
在日常環境中,機器人需要的往往不只是精準的空間定位,更需要像人類一樣快速反應、掌握時機。Gemini Robotics ER 2 被定位為機器人的「高階大腦」,專門負責對話、理解物理世界以及規劃多步驟任務,並將低階的動作執行交由視覺-語言-動作(VLA)模型處理。
新一代模型整合了 Gemini Live API,透過雙向串流端點大幅降低延遲。這讓機器人能夠在執行動作的同時同步進行思考,擺脫過去常見的「停頓與思考」延遲感。Google DeepMind 也與波士頓動力(Boston Dynamics)合作展示相關應用,透過 Spot APIs 指揮 Spot 執行拿取爆米花等互動任務。
精準掌握任務進度與時間點
機器人過去面臨的一大難題是「如何判斷任務已經完成」。Gemini Robotics ER 2 在影片理解與進度追蹤上有顯著躍升,帶來兩大核心能力:
- 連續進度分類(Progress Classification):透過分析影片畫面的五個階段(0% 至 100%),讓機器人擁有即時的現場情境意識,能在發生失誤時即時調整或重試,無須重啟整個工作流程。
- 精準時刻尋找(Precision Moment-Finding):能夠以高達 91.3% 的準確度和極低的時間誤差(0.96 秒平均絕對距離),精準鎖定關鍵事件發生的影格(例如倒咖啡的最佳停止時機),以次秒級的反應速度確保操作安全。
多機協作與強化的安全機制
單一機器人難以應付所有環境需求,Gemini Robotics ER 2 因此支援多機器人協作,讓不同型態的機器人(如輪式機器人與雙足人形機器人)透過共用的語意理解來互相交接並完成複雜任務,例如串聯 Apptronik 的 Apollo 2 與 Franka F3 Duo 共同作業。
此外,在安全性方面,新模型在「安全指令遵循」與「人類鄰近度」評測中表現優異。當偵測到人類靠近時,人形機器人能夠自動暫停,並在區域安全後自動恢復作業,大幅提升人機協作的安全性。
從產業面來看,Gemini Robotics ER 2 不僅解決了機器人在實際應用中的許多痛點,更為未來的智慧工廠和智慧家庭打下了堅實的基礎。這款模型的推出,預示著機器人技術將更加貼近人類的生活,帶來更多便利與效率。
展望與影響
Gemini Robotics ER 2 的推出,標誌著實體 AI 技術的一個重要里程碑。未來,這項技術有望在製造業、醫療護理、家務助手等多個領域發揮巨大作用,推動產業轉型和社會進步。目前,Gemini Robotics ER 2 已通過 Gemini API 與 Google AI Studio 向開發者全面開放,並在 Gemini Enterprise Agent Platform 提供私人預覽。
讀者們,你是否對這項技術感到好奇?不妨深入了解並探索其潛在應用,或許你也能成為這場技術革新的參與者。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
Gemini Robotics ER 2 是什麼?
Gemini Robotics ER 2 是 Google DeepMind 推出的「具身推理」模型,旨在提升機器人在真實物理世界中的表現,特別是在即時決策和多機器人協作方面。
Gemini Robotics ER 2 有哪些主要特點?
Gemini Robotics ER 2 主要特點包括即時決策、多機器人協作、精準掌握任務進度與時間點,以及強化的安全機制。
Gemini Robotics ER 2 將如何影響未來的產業?
Gemini Robotics ER 2 將在製造業、醫療護理、家務助手等多個領域發揮巨大作用,推動產業轉型和社會進步,提高生產效率和安全性。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。