Anthropic Claude 机器人评估显示高层控制快速进步,但直接扭矩控制能力有限
摘要
Anthropic 2026年7月的机器人基准测试表明,最新的 Claude 模型能够可靠地指导预训练的运动和操作策略完成现实世界任务,但直接进行低层电机扭矩控制仍不可靠,适用于各类机器人平台。
关键发现:控制接口决定性能表现
- 接口的重要性不亚于模型规模。 相同的 Claude 模型在发出原始扭矩指令时得分接近零,但在监督预训练策略时,于 Embody 基准测试中取得了最高综合得分。
- 高层接口(策略监督、VLA 框架)始终优于低层接口。 所有模型在人形和四足机器人上直接控制扭矩均失败;程序化或基于策略的控制方式则能实现可测量的成功。
代际进步不均衡
- 高层控制进步显著。 Claude Opus 4.5 → Opus 4.7 和 Mythos Preview 在高层运动综合得分上大幅提升(最高 +15 分)。
- 低层控制仅小幅改善。 各代模型的直接控制得分略有上升,但许多新模型(如 Opus 4.6)仍无法从俯卧姿态让四足机器人站立。
- 强化学习监督落后于代码控制。 仅有 GPT-5.4 能可靠学习混沌 TwinFlipper 任务的高效策略;其他模型的表现甚至不如它们直接编写 Python 控制器时。
运动表现
| 机器人 | 任务 | 表现最佳的 Claude 模型 | 接口 |
|---|---|---|---|
| Unitree Go2(四足) | 平衡(≈2 秒) | Opus 4.6 / Mythos Preview | 程序化(Python) |
| Unitree Go2 | 前进行走 | Opus 4.6(程序化) | — |
| Unitree G1(人形) | 从倒地状态站起 | 无(无模型成功) | 直接 / 程序化 |
- 高层导航(11 项任务,如 find_x、maze、drift_detection)使用预训练摇杆策略和指南针工具,Mythos Preview 综合得分为 54/100。
- 感知辅助:添加指南针能持续提升各模型表现;第三人称摄像头仅对最强模型(Opus 4.7、Mythos Preview)有帮助。
操作表现
| 平台 | 任务 | 表现最佳的 Claude 模型 | 成功率 |
|---|---|---|---|
| Franka Panda 机械臂(LIBERO) | 直接末端执行器控制 | Mythos Preview | 总体任务成功率 5.5 % |
| 同一平台 | VLA 监督操作(40 项 LIBERO 任务) | Opus 4.6 / Opus 4.5 | 约 30 % 任务成功率(VLA 单独使用为 70 %) |
- 直接控制:模型越来越能接近目标物体并实现接触,但完整抓取仍极为罕见(0–5 %)。
- VLA 监督:所有模型在可接受、编辑或替换 VLA 动作时表现提升。Claude 模型比 GPT-5.4 或 Gemini 3.1 更频繁遵循 VLA 建议,从而降低“控制惩罚”。
- 新任务:Opus 4.5–4.7 能识别 VLA 失败并减少盲目服从,净提升高于旧模型。
视觉与工具消融实验
- 深度图、分割图和十字准星 对操作帮助甚微;光标工具(交互式点查询)使 Mythos Preview 在 10 项任务子集上的成功率从 6 % 提升至 32 %。
- 指南针 是运动中最有效的辅助工具,使每种配置得分提升 5–12 分。
- 原始图像 vs. 文本场景描述:旧版 Claude 模型在文本描述下表现更好,表明其像素级空间推理能力较弱。新版 Claude 模型(Opus 4.6、Opus 4.7)和 Gemini 在图像被替换后性能下降,说明它们已能提取有用视觉信息。
推理预算影响
- 对大多数 Claude 代际的典型控制、运动和操作任务影响极小。
- 例外情况:Mythos Preview 在自适应最大推理预算下表现明显提升;GPT-5.4 在运动任务中受益;Gemini 3.1 表现混合。
- 总体而言:额外推理能力本身无法弥合低层与高层控制之间的差距。
短期上下文学习
- 经典控制:后期 Claude 模型主要通过迭代失败尝试来改进,而非初始表现更强。
- 上下文截断:移除早期对话回合通常不会损害性能;有时反而有益(“上下文腐化”)。Mythos Preview 保持稳健,表明其已内建策略。
- 高层运动练习:Mythos Preview 在单次示例后即可学会简单 L 形路径,而 Opus 模型需多次重复。
在真实 Unitree Go2 机器人上的验证
- Find-X 任务:模型常未达到要求的 1 米接近距离;旧模型常对齐错误或误将反射当作目标。
- 办公室环路导航:所有模型因视觉-记忆错误失败(遗漏转向提示、过度穿越走廊)。
- 工具使用:十字准星帮助模型判断对齐,但可能误导其对障碍物的判断(例如,走入十字准星左侧出现的垃圾桶)。
安全影响
- 能力波动:微小的工具变更(如添加指南针)可使模型的物理影响提升数个数量级。
- 评估必须包含访问级别:仅测试孤立 LLM 的基准测试会低估真实世界中模型与高效控制器结合时的潜力。
- 监督 vs. 自主:当前最佳实践是让语言模型监督预训练策略,而非取代它;这能限制不安全的低层动作,同时仍提供有效指导。
对研究人员与实践者的启示
- 部署 LLM 到机器人时优先选择高层接口;直接扭矩控制仍不可靠。
- 提供方向工具(指南针、光标)以缓解感知瓶颈。
- 预期感知和短期适应能力快速提升,但不要假设长期规划能力已成熟。
- 在策略监督周围设计安全防护——允许 LLM 拒绝或调整动作,但保持低层控制器为最终决策者。
- 使用完整系统(LLM + 策略 + 工具)进行基准测试,以获得真实的能力评估。
所有图表、表格和定量评分均来自 Anthropic 原始文章《How Claude Performs on Robotics Tasks》(2026-07-09)。未添加任何虚构数据。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch