Gemini Robotics 2 版本說明 / 新功能

Google DeepMind 已發布 Gemini Robotics 2,這是一層智慧層,旨在將機器人從預先編程的序列推向可適應的通用物理 AI。此更新引入了人形機器人的全身控制、各種末端執行器的高精度靈巧度,以及針對複雜多步任務執行的代理推理。

Gemini Robotics 2 模型套件

Gemini Robotics 2 由三個專門模型組成,處理機器人智慧的不同層面,從高層規劃到低層馬達控制:

  • Gemini Robotics 2 (VLA): 一種視覺-語言-動作模型,將視覺與語言輸入直接轉換為馬達控制。它支援完整的人形機器人與雙臂機器人,提供從「腳到指尖」的控制。
  • Gemini Robotics ER 2(具身推理): 一種視覺-語言模型(VLM),作為代理的高層大腦。它負責人類溝通、物理世界的理解,以及可持續數分鐘的多步任務規劃。
  • Gemini Robotics On-Device 2(VLA): 一個高效的 VLA 模型,針對本地執行進行優化,以消除網路延遲。它具備快速適應能力,允許在僅有數小時資料的新機器人形態上部署。

全身控制與人形機器人運動

Gemini Robotics 2 將物理 AI 從上半身桌面任務擴展到完整的全身協調。這使得人形機器人能在為人類設計的環境中導航與操作物體,需要執行走路、蹲下與伸展等動作。

在使用 Apptronik Apollo 2 人形機器人的示範中,模型成功處理了將澆水壺從桌子移至底層架子上特定箱子的指令,這需要機器人走路、拾取物體並精確放置。

手部與夾爪的高階靈巧度

系統在不同類型的硬體末端執行器上引入了更高的精細度:

  • 多指手: 在 Apollo 2 上使用 22 自由度的 SharpaWave 手,模型能執行如封口拉鍊袋或打結等精細任務。
  • 平行夾爪: 在 Franka Duo 平台上,模型利用標準的雙指夾爪執行如緊密打包等複雜靈巧任務。

代理推理與多機器人協作

Gemini Robotics ER 2 使機器人能執行持續數分鐘、包含數百個決策的較長任務序列。模型現在能更好地辨識任務的開始與結束,並在執行過程中精確定位關鍵事件。

主要功能包括:

  • 自我校正: 推理模型允許機器人對新情況進行概括,並在序列中的特定步驟失敗時自行校正。
  • 多機器人協作: 不同類型的機器人現在可以溝通與協調,解決超出單一機器人能力的複雜工作流程。

本地適應與動作轉移

Gemini Robotics On-Device 2 採用「動作轉移」技術,快速適應新機器人硬體。模型能在僅少於 200 個範例與數小時的適應時間內,適應全新雙臂機器人形態——即使其感測器、形狀與自由度差異顯著。此功能已在 Dexmate、SO101 與 Trossen 平台上示範。

安全框架與 ASIMOV-Agentic

Google DeepMind 已實施多層次的安全方法,結合實體安全措施與 AI 安全框架。

為評估這些系統,他們推出 ASIMOV-Agentic,一項針對代理安全協調與不確定性解決的基準測試。此基準測量:

  1. 具身推理代理拒絕來自 VLA 的不安全工具呼叫的能力。
  2. 預測任務是否可行,並在不確定時主動請求人類介入的能力。

據報導,Gemini Robotics ER 2 是迄今為止在人類接近基準與安全約束遵循方面最安全的機器人模型,具備觸發安全工具呼叫並在有人類過於接近時停止機器人的能力。

Sources