Anthropic Claude 機器人評估顯示高階控制快速進步,但直接扭矩掌控能力仍有限
簡要重點
Anthropic 的 2026 年 7 月機器人基準測試顯示,最新的 Claude 模型能成功引導預訓練的移動與操作策略完成真實世界任務,但在要求直接發出原始馬達扭矩或力量時仍會失敗。
關鍵發現:控制介面決定表現
- 介面的重要性不亞於模型規模。 同一 Claude 模型在發出原始扭矩時得分接近零,但在監督預訓練策略時於 Embody 基準測試中卻能取得最高綜合分數。
- 高階介面(策略監督、VLA 支架)持續優於低階介面。 所有模型在人形與四足機器人身上直接扭矩控制均失敗;程式化或策略式控制則能產生可量化的成功。
世代進步不均
- 高階進步明顯。 Claude Opus 4.5 → Opus 4.7 與 Mythos Preview 在高階移動綜合分數上出現大幅躍升(最高 +15 分)。
- 低階控制僅小幅改善。 直接控制分數雖隨世代略有上升,但許多新模型(例如 Opus 4.6)仍無法從俯臥姿勢站起四足機器人。
- 強化學習監督落後於程式碼控制。 僅 GPT-5.4 能可靠學習混沌的 TwinFlipper 任務的合格策略;其他模型表現甚至不如僅撰寫 Python 控制器時。
移動結果
| 機器人 | 任務 | 表現最佳的 Claude 模型 | 介面 |
|---|---|---|---|
| Unitree Go2(四足) | 平衡(≈2 秒) | Opus 4.6 / Mythos Preview | 程式化(Python) |
| Unitree Go2 | 前進行走 | Opus 4.6(程式化) | — |
| Unitree G1(人形) | 從倒地姿勢站起 | 無(無模型成功) | 直接 / 程式化 |
- 高階導航(11 個任務,例如 find_x、maze、drift_detection)使用預訓練搖桿策略與指南針工具,Mythos Preview 綜合分數達 54/100。
- 感知輔助:加入指南針可穩定提升各模型表現;第三人稱鏡頭僅對最強模型(Opus 4.7、Mythos Preview)有幫助。
操作結果
| 平台 | 任務 | 表現最佳的 Claude 模型 | 成功率 |
|---|---|---|---|
| Franka Panda 臂(LIBERO) | 直接末端執行器控制 | Mythos Preview | 整體任務成功率 5.5 % |
| 同一平台 | VLA 監督操作(40 任務 LIBERO) | Opus 4.6 / Opus 4.5 | 約 30 % 任務成功率(VLA 單獨為 70 %) |
- 直接控制:模型越來越能抵達目標物並接觸,但完整抓取仍極為罕見(0–5 %)。
- VLA 監督:所有模型在能接受、編輯或替換 VLA 行動時表現提升。Claude 模型比 GPT-5.4 或 Gemini 3.1 更常遵循 VLA 建議,降低「控制懲罰」。
- 新任務:Opus 4.5–4.7 能識別 VLA 失敗並減少拖延,淨提升高於舊模型盲目遵循策略的情況。
視覺與工具消融分析
- 深度圖、分割與十字準星 對操作幫助甚微;游標工具(互動式點查詢)使 Mythos Preview 在 10 任務子集上的成功率從 6 % 提升至 32 %。
- 指南針 是移動最有效的輔助工具,使每種配置提升 5–12 分。
- 原始影像 vs. 文字場景描述:舊版 Claude 模型在文字描述下表現較佳,顯示其像素級空間推理能力薄弱。新版 Claude 模型(Opus 4.6、Opus 4.7)與 Gemini 在影像被取代時表現下降,顯示其已能提取有用的視覺資訊。
推理預算影響
- 對大多數 Claude 世代的經典控制、移動與操作影響極小。
- 例外:Mythos Preview 在自適應最大推理預算下明顯受益;GPT-5.4 在移動上獲益;Gemini 3.1 呈現混合效果。
- 總體而言:額外推理本身無法彌補低階與高階控制之間的差距。
短期上下文學習
- 經典控制:後期 Claude 模型主要透過重複失敗嘗試改善,而非起始表現更佳。
- 上下文截斷:移除早期回合通常不會損害表現;有時反而有助(「上下文腐化」)。Mythos Preview 仍具韌性,顯示其內建策略。
- 高階移動練習:Mythos Preview 僅需單一範例即可學習簡單的 L 形路徑,而 Opus 模型則需多次重複。
在實體 Unitree Go2 上的真實世界驗證
- 尋找 X 任務:模型常未達要求的 1 公尺接近距離;舊模型會誤對齊或將反射誤認為目標。
- 辦公室迴路導航:所有模型因視覺記憶錯誤失敗(遺漏轉彎提示、過度穿越走廊)。
- 工具使用:十字準星幫助模型判斷對齊,但可能誤導其對障礙物的判斷(例如走進十字準星左側出現的垃圾桶)。
安全意涵
- 能力波動:微小的工具變更(例如加入指南針)可使模型的物理影響力提升數個數量級。
- 評估必須包含存取層級:僅測試孤立 LLM 的基準會低估真實世界中模型與優秀控制器結合時的實際能力。
- 監督 vs. 自主:目前最佳做法是讓語言模型監督預訓練策略,而非取代它;這可限制不安全的低階動作,同時仍提供有用指導。
研究人員與實務工作者的重點提醒
- 部署 LLM 於機器人時,優先選擇高階介面;直接扭矩控制仍不可靠。
- 提供方向工具(指南針、游標)以緩解感知瓶頸。
- 預期感知與短期適應能力快速提升,但勿假設長期規劃能力已達成。
- 在策略監督周圍設計安全防護——允許 LLM 拒絕或調整動作,但保持低階控制器為最終決策者。
- 以完整堆疊(LLM + 策略 + 工具)進行基準測試,以獲得真實的能力估計。
所有圖表、表格與量化分數均來自 Anthropic 原始文章「How Claude Performs on Robotics Tasks」(2026-07-09)。未新增任何資料。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch