Google DeepMind 發表 Gemini Robotics ER 2,讓人形機器人具備全身協調推理能力
2026-07-30
事件摘要
Google DeepMind 於 7 月 30 日發表新一代機器人 AI 模型 Gemini Robotics ER 2,定位為機器人的「高階大腦」,負責即時空間推理與多步驟任務規劃,並統籌底層的視覺-語言-動作(VLA)模型執行實際動作。相較於前一代模型主要控制機器人上半身,Gemini Robotics ER 2 能夠指揮人形機器人從頭到腳的全身動作,包含行走、蹲下與物體操作的協調推理。模型在影片理解與任務進度追蹤上,任務完成度分類準確率達 57.4%,關鍵事件時間點判斷準確率達 91.3%(平均誤差 0.96 秒);透過整合 Gemini Live API,模型能以低延遲、連續流暢的方式執行任務,避免「停下來思考」的斷點式反應。模型也支援多台不同機器人透過共享語意理解彼此溝通協作,並在安全指令遵循與人員接近偵測等安全性基準上取得明顯進步。這項技術已在 Boston Dynamics 的 Spot 機器狗(以自然語言指令取物示範)與 Apptronik 的 Apollo 2、Franka F3 Duo 之間的多機器人協作場景中展示,並透過 Gemini API、Google AI Studio 與 Gemini Enterprise Agent Platform 對外開放。
技術意義解讀
「高階大腦統籌底層 VLA 模型」這個分層架構,反映的是機器人 AI 系統設計上一個逐漸成形的共識——把「理解環境、規劃任務、判斷何時該做什麼」跟「精確執行單一動作的即時控制」拆分成兩個不同時間尺度、不同運算需求的模組分開處理,而不是用單一模型同時包辦所有層次的決策。這種分層設計讓上層的推理模型可以專注在需要長時間脈絡理解與多步驟規劃的任務上,底層動作模型則能維持高頻率、低延遲的即時反應,兩者各自最佳化,也讓同一套高階大腦有機會跨接到不同硬體平台的底層動作模型上——這正是 Google DeepMind 能同時在 Boston Dynamics 的四足機器狗與 Apptronik 的人形機器人上展示同一套 ER 2 模型的技術基礎。
多台不同廠商、不同型態機器人之間透過共享語意理解進行協作,也代表機器人產業正在從「單機自主」邁向「多機協同」的下一個發展階段——過去機器人之間的協作多半仰賴預先設計好的通訊協定與固定分工規則,Gemini Robotics ER 2 展示的是讓機器人透過對任務與環境的共同語意理解自行協調分工,這種能力如果能大規模落地,對於本站另一篇報導提到的「多品牌機器人共享同一物理空間時彼此協調困難」這類問題,會是一個潛在的技術解方,但這也仰賴不同廠商的機器人願意採用同一套跨平台的高階推理模型作為協作基礎。