Gemini Robotics 2:提升全身智慧與靈巧度

Gemini Robotics 2 讓全身協調與多機器人團隊合作成為可能

Google DeepMind 已發布 Gemini Robotics 2,這是一層智慧層,旨在將機器人從預先編程、重複性的任務推向通用的實體 AI。該系統使機器人能夠推理複雜的動作,協調從腳到指尖的全身動作,並與其他機器人合作完成多步工作流程。

三模型架構

Gemini Robotics 2 由三個專門模型驅動,將高層推理與低層馬達控制的工作分開:

  • Gemini Robotics 2 (VLA): 一個視覺‑語言‑動作模型,直接將視覺與語言輸入轉換為馬達控制。它管理完整的人形動作以及五指手與平行夾爪的高靈巧度操作。
  • Gemini Robotics ER 2 (ER): 一個具身推理模型 (VLM),充當代理人的「大腦」。它處理人類溝通、環境理解,以及持續數分鐘的多步任務規劃。此模型亦協調多機器人合作。
  • Gemini Robotics On-Device 2 (VLA): 一個為本地執行優化的高效 VLA 模型,以消除網路延遲。它具備「動作轉移」功能,能在數小時內、使用不足 200 個範例,適應不同形狀、感測器與自由度的機器人體態。

全身控制與先進靈巧度

Gemini Robotics 2 將實體 AI 從簡單的桌面任務擴展到全身協調。透過將意圖轉換為全身控制,系統能管理諸如走向目標、蹲下、精確將物體放置於底層架子等複雜序列。

高精度操作

系統在不同硬體末端執行器上展示了顯著的靈巧度提升:

  • 五指手: 在 Apollo 2 人形機器人上使用 22 自由度的 SharpaWave 手,模型能執行結繩或封口拉鍊袋等精細任務。
  • 平行夾爪: 在 Franka Duo 平台上,模型使用標準雙指夾爪完成複雜的打包任務。

代理推理與安全協調

為了管理持續數分鐘、涉及上百次決策的任務,Gemini Robotics ER 2 提供高層次的協調。它觀察環境、推理所需步驟,並在特定動作失敗時自行校正。

安全性與 ASIMOV‑Agentic 基準

Google 推出了 ASIMOV‑Agentic,一項全新的代理安全協調基準。此框架衡量機器人在以下方面的能力:

  1. 拒絕 VLA 所請求的不安全工具呼叫。
  2. 預測任務是否在物理上可行。
  3. 在不確定性高時主動請求人類介入。

此外,Gemini Robotics ER 2 也被設計為能偵測人類接近,並觸發安全停止,以符合協作安全標準。

技術觀點與社群討論

雖然公告突顯了重大進展,技術社群仍提出多項關於 LLM 為基礎的機器人實際部署的關鍵問題:

延遲與控制

部分開發者認為使用完整 LLM 進行驅動可能會產生不可接受的延遲(估計 1‑2 秒),這對即時機器人而言不切實際。常見的對策是將機器視覺交給機器學習,卻保留傳統的 PID 式線性/非線性控制來執行動作。

硬體與安全顧慮

使用者討論中指出,強大的人形機器人在家庭環境中可能面臨「訴訟風險」,因為足以執行重活的機器人,同樣也可能在故障時造成嚴重傷害。

效能指標

批評者引用隨附的技術數據,指出成功率約為 60%,精確度為 80%,認為這些數字顯示技術尚未達到可投入自動化家庭或工業使用的生產階段。

"If progress is as fast as LLMs, this could have massive applications in a few years." — @FartyMcFarter

"The big one will be using AI to design and build highly specialized robots to automate mining and manufacturing." — @baron816

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch