Gemini Robotics-ER 1.6 版本說明 / 新功能

Gemini Robotics-ER 1.6 版本說明 / 新功能

Google DeepMind 推出了 Gemini Robotics-ER 1.6,一款以推理為先的模型,旨在提升「具身推理」——即機器人將數位智慧與實體行動結合的能力。此更新大幅增強了空間推理、多視角理解與任務成功偵測,使實體代理人能達到更高的自主水平。

高階推理與整合

Gemini Robotics-ER 1.6 作為機器人的高階推理引擎。它能透過原生呼叫各種工具來執行複雜任務,包括:

  • Google Search: 用於檢索外部資訊。
  • Vision-Language-Action (VLA) models: 用於將推理轉換為實體動作。
  • Third-party user-defined functions: 用於自訂機器人整合。

該模型相較於 Gemini Robotics-ER 1.5 與 Gemini 3.0 Flash 展示了顯著的效能提升,尤其在指向、計數與成功偵測方面。

透過指向的空間推理

指向被作為空間推理的基礎能力,使模型能執行多項關鍵機器人功能:

  • Precision Object Detection and Counting: 在場景中辨識並計算特定物件。
  • Relational Logic: 定義「從‑到」關係(例如將物件移動至特定位置)並進行比較,如辨識集合中最小的項目。
  • Motion Reasoning: 繪製軌跡並找出最佳抓取點。
  • Constraint Compliance: 依據提示進行推理,例如「指向所有足以放入藍色杯子內的物件」。

Gemini Robotics-ER 1.6 使用指向作為中間步驟,以執行數學運算,提升度量估計的精確度並更準確地計算物件數量。在比較測試中,它在辨識正確工具數量以及避免出現圖像中不存在的虛構物件方面,優於 Gemini Robotics-ER 1.5。

自主成功偵測

成功偵測讓機器人能判斷任務是否完成,從而決定是重試失敗的嘗試還是繼續執行計畫中的下一步。Gemini Robotics-ER 1.6 改善了多視角推理,這對於處理遮蔽與光線不足的情況至關重要,透過合成多個相機串流的資訊(例如結合俯視鏡頭與腕部鏡頭)以形成對環境的連貫理解。

透過主體視覺的儀表讀取

此功能與 Boston Dynamics 合作開發,Gemini Robotics-ER 1.6 引入了讀取複雜工業儀表的能力,例如圓形壓力表、垂直水平指示器與數位讀值。對於像 Spot 這樣的設施檢查機器人而言,特別有用。

為了達到高精度,模型採用「主體視覺」,透過多步驟流程結合視覺推理與程式碼執行:

  1. Zooming: 模型放大影像以捕捉儀表上的細微細節。
  2. Estimation: 它利用指向與程式碼執行來估算比例與間隔。
  3. Interpretation: 它運用世界知識解讀最終讀數,包含單位與小數位。

"像儀表讀取這類能力以及更可靠的任務推理,將使 Spot 能夠完全自主地觀察、理解並回應現實世界的挑戰。"

— Marco da Silva, Vice President and General Manager of Spot at Boston Dynamics

安全性與約束遵循

Gemini Robotics-ER 1.6 被描述為 Google DeepMind 迄今最安全的機器人模型,並在對抗性空間推理任務上提升了對 Gemini 安全政策的遵循。

主要的安全改進包括:

  • Physical Safety Constraints: 更好地遵守諸如「不要處理液體」或「不要搬運重於 20kg 的物件」等約束。
  • Hazard Identification: 在基於真實傷害報告的測試(Asimov 基準)中,模型在文字情境下較 Gemini 3.0 Flash 提升 6%,在影片情境下提升 10%,以更精確感知受傷風險。

可用性

開發者可透過 Gemini API 與 Google AI Studio 取得 Gemini Robotics-ER 1.6。Google 亦提供了開發者用的 Colab 筆記本,內含設定模型以執行具身推理任務的範例。

Sources