Gemini Robotics 1.5 與 Gemini Robotics-ER 1.5 發布

Google DeepMind 已發布 Gemini Robotics 1.5 與 Gemini Robotics-ER 1.5,這兩款專門模型旨在將 AI 代理從數位環境轉移至實體世界。透過將認知負荷分割為高階規劃與低階馬達執行,這些模型使機器人能感知、規劃與行動,以更高的透明度與泛化能力解決複雜的多步任務。

代理框架:協調與執行

Google DeepMind 採用雙模型代理框架來處理現實任務的複雜性,例如根據在地回收指南對物品進行分類。

Gemini Robotics-ER 1.5(具身推理)

Gemini Robotics-ER 1.5 作為系統的「高階大腦」。它是一個針對具身推理優化的視覺語言模型(VLM),負責協調機器人的整體活動。其主要功能包括:

  • 規劃與決策制定: 建立詳細的多步計畫以完成任務。
  • 工具整合: 原生呼叫數位工具,例如 Google Search,或第三方使用者自訂函式,以取得必要資訊。
  • 空間理解: 在空間理解基準測試中達到最先進的表現,涵蓋指向、影像問答與影片問答等。
  • 監控: 在任務執行過程中估算自身的成功率與進度。

Gemini Robotics 1.5(視覺語言行動)

Gemini Robotics 1.5 是一個視覺語言行動(VLA)模型,將 ER 模型提供的自然語言指示轉換為直接的馬達指令。與僅將計畫翻譯成動作的傳統 VLA 模型不同,Gemini Robotics 1.5 會「先思考再行動」,以自然語言產生內部的推理與分析序列。這使得機器人能夠:

  • 拆解複雜任務: 將較長的任務分解為更簡單、較短的段落,以提升執行可靠性。
  • 提升透明度: 以自然語言說明其思考過程,讓使用者能看見決策過程。
  • 增強韌性: 更好地泛化至新任務,並適應環境變化。

跨具身學習與泛化

Gemini Robotics 1.5 解決了在不同形狀、尺寸與自由度的機器人之間轉移技能的挑戰。該模型展示了跨具身學習的能力,意味著在一台機器人上學習的動作可直接轉移至另一台機器人,而無需為每種新硬體配置進行模型專門化。

Google DeepMind 在多個平台上觀察到此能力:在 ALOHA 2 機器人上訓練的任務成功由 Apptronik Apollo 人形機器人以及雙臂 Franka 機器人執行,反之亦然。

效能基準與安全性

空間推理基準

Gemini Robotics-ER 1.5 在 15 個學術基準上進行評估,達到最先進的綜合表現。這些基準包括:

  • 具身推理問答(ERQA)
  • Point-Bench
  • RefSpatial, RoboSpatial-Pointing, Where2Place, BLINK, CV-Bench, EmbSpatial, MindCube, RoboSpatial-VQA, SAT, Cosmos-Reason1, Min Video Pairs, OpenEQA, and VSI-Bench.

語意安全與 ASIMOV 基準

為確保在人本環境中的負責任部署,Google DeepMind 更新了 ASIMOV 基準,這是一套用於評估語意安全的資料集。Gemini Robotics-ER 1.5 在此基準上展現最先進的表現。

安全性透過全方位的方式實施:

  • 高階推理: 模型在行動前考慮安全限制。
  • 政策對齊: 對話遵循 Gemini 安全政策。
  • 低階觸發: 系統可在必要時觸發機載安全子系統,例如防碰撞。

可用性

  • Gemini Robotics-ER 1.5: 透過 Google AI Studio 中的 Gemini API 向開發者開放。
  • Gemini Robotics 1.5: 目前僅提供給特定合作夥伴。

Sources