Gemini Robotics ER 2 版本說明 / 新功能
Google DeepMind 推出了 Gemini Robotics ER 2,一個高階的「具身推理」模型,旨在作為機器人的大腦。該模型使機器人能夠與人類互動、理解物理環境,並規劃多步任務,然後將這些任務交給較低層級的視覺-語言-動作(VLA)模型執行動作。
即時任務編排與代理能力
Gemini Robotics ER 2 作為一個實體代理,編排複雜的多步工作流程,使機器人能自行校正並推廣至新情境。開發者可以整合低階控制介面——例如導航 API 或 VLA 模型——作為模型可原生呼叫的工具,並可同時使用 Google Search 等工具。
編排方面的主要改進包括:
- 延遲降低: 透過雙向串流端點與 Gemini Live API 的整合,減少「停下思考」的暫停,使任務執行更流暢。
- 效能提升: 該模型在工具編排方面持續優於 Gemini Robotics ER 1.6,無論是在真實 VLA、模擬 VLA 或人類遠端操作模式下。
- 實務應用: 在與 Boston Dynamics 的 Spot 示範中,模型編排 Spot 的導航與機械手臂移動 API,根據自然語言指令取得物件。
時間智慧與影片理解
Gemini Robotics ER 2 在「時間智慧」方面帶來重大突破,使機器人能追蹤進度並辨識任務切換的精確時刻。
持續進度分類
該模型可透過將影片串流中的畫面分配至五個進度等級(0-20% 至 80-100%)來追蹤任務完成度。這使機器人能即時調整動作或在失敗步驟時重試,而無需重新啟動整個工作流程。Gemini Robotics ER 2 在進度分類上達到 57.4% 的準確率,超越前一代及其他前沿模型。
精準時刻偵測
為了精確判斷何時切換任務(例如何時停止倒液),模型使用時刻偵測。其準確率達 91.3%,平均絕對距離為 0.96 秒。此精度以比大型模型類別快 4 倍的執行速度提供,滿足安全實際操作所需的次秒級延遲。
多機器人協作與空間智慧
Gemini Robotics ER 2 讓不同的機器人透過共享的語意理解進行溝通,完成單一機器人無法獨立執行的任務。此協作已在 Apptronik 的 Apollo 2 與 Franka F3 Duo 上示範。
此外,模型在三個核心領域提升了通用空間智慧:
- 成功/失敗偵測: 現在使用原始影片串流而非靜態快照,偵測執行過程中的失誤,如滑倒或灑漏。
- 通用儀表讀取: 模型現在能讀取 10 種不同的儀表,包括數位顯示、線性刻度與液體溫度計等。
- 強化空間 VQA: 透過先進的多模態理解,提升視覺問答能力。
安全與人類接近
Gemini Robotics ER 2 被描述為 Google DeepMind 迄今最安全的具身推理模型。它在安全指令遵循與人類接近基準測試中顯著提升,具體展現了在人員靠近時能停止類人機器人,且僅在區域清空後才恢復運作的能力。
Google DeepMind 亦推出了新基準,用以評估基礎模型作為安全 VLA 編排者的能力,透過監控環境、執行安全限制並評估物理可行性。