GPT-6 Astra 机械臂基准测试:95% 成功率的积木放置 vs. Claude Fable 5.1 的 40%

底线性能

GPT‑6 Astra 在 20 次试验中完成了 19 次「积木放入碗中」任务(95% 成功率),每次运行仅耗资 $0.94,每次试验耗时 2.5 分钟,优于 Claude Fable 5.1(8/20,$2.12,6.8 分钟)和 Claude Fable 5(1/20,$2.69,8.2 分钟)。 在更复杂的「拼图插入凹槽」任务中,Astra 与 Fable 5.1 一样,成功率均为 2/20,均在最后插入步骤卡住。


为何碗任务至关重要

  • 碗任务隔离了基本的抓取与放置能力:抓取、提升、运输和释放。
  • Astra 的平均阶段得分为 3.95(满分 4),表明其能稳定到达最终放置阶段,而 Fable 5.1 平均为 2.40,Fable 5 仅为 1.30
  • Token 使用量大幅下降:Astra 每次运行约使用 2 k 输出 Token,而 Fable 5 约为 13 k,这意味着更低的推理成本。

拼图插入凹槽任务揭示了局限性

  • 该任务要求将圆形部件精确对齐至圆形凹槽,测试精细的空间推理能力。
  • Astra 和 Fable 5.1 的平均阶段分别为 2.002.35,表明它们能接近凹槽但未能完成插入。
  • Astra 每次运行成本($1.36)仍低于 Fable 5.1($2.18),但成功率相同(10%)。

实验设置

  • 硬件:双臂 I2RT YAM 机械臂(每臂 6 自由度),配备平行爪夹持器,通过三台摄像头(顶部、左腕、右腕)加本体感知进行观察。
  • 控制:将绝对末端执行器位姿(move_to)输入机器人 IK 求解器。
  • 策略:使用 Inspect‑Robots 框架(v0.58.0)中的 agent 策略,中等推理努力,20 次 LLM 调用预算,25 % 速度限制。
  • 试验:每模型每任务 20 次运行;Astra 的碗任务在 rig‑1 上进行,Fable 模型在 rig‑3 上进行;所有模型的拼图任务在 rig‑4 上进行。
  • 评分:人工评分员为每次试验分配阶段(0–4);评分标准与之前的 Fable 报告一致。

成本与延迟分解

模型 任务 平均输出 Token 数 估算 $/运行 平均时间(分钟)
GPT‑6 Astra 2.1 k $0.94 2.5
Claude Fable 5.1 12.9 k $2.12 6.8
Claude Fable 5 19.2 k $2.69 8.2
GPT‑6 Astra 拼图 2.7 k $1.36 3.4
Claude Fable 5.1 拼图 10.5 k $2.18 5.9
Claude Fable 5 拼图 16.3 k $2.63 7.9
  • 成本按列表价格计算($10 / M 输入 Token,$50 / M 输出 Token),未考虑 OpenAI 的自动输入缓存,这将进一步降低 Astra 的实际成本。

Hacker News 社区见解

@baron816 – 建议将重点放在公共利益型机器人(如人行道垃圾清理)上,作为早期市场以展示价值并建立信任。

@gizmodo59 – 赞扬 Astra 在计算机使用任务中的速度和多功能性,认为 200 美元订阅费物有所值。

@scronkfinkle – 质疑 LLM 何时能处理洗衣等日常家务,指出令人印象深刻的演示与实际家庭自动化之间存在差距。

@yurimo – 批评实验范围有限,指出对外部 IK 控制器的依赖以及未与端到端 VLA/WAM 架构进行比较。

@SillyUsername – 报告在小型开源机械臂上使用 Astra 的负面体验,称其成本更高且代码生成质量差。

@sheeshkebab – 将结果总结为「半稳定地以一岁儿童水平移动积木」,强调了虽小但真实的技术进步。


需要注意的局限性

  • 时间分离 – Astra 的运行比 Fable 运行晚了两天;环境变化可能影响性能。
  • 设备不匹配 – Astra 的碗任务使用了与 Fable 试验不同的物理设备,可能影响成功率。
  • 人工评分偏见 – 评分员知道每项运行由哪个模型生成,存在无意识偏见的可能性。
  • 成本通胀 – 使用了列表价格 Token 成本;OpenAI 的缓存可能使 Astra 的真实成本更低,而 Anthropic 的运行未受益于缓存。
  • 手动重置 – 试验之间通过人工重新定位物体,引入了变异性。
  • 推理努力 – 所有模型均以 中等 努力运行;更高努力设置可能改变结果。

这对 LLM 驱动的机器人意味着什么

  • 效率提升 – Astra 的 Token 高效提示和更快的推理转化为简单操作的显著更低的单次运行成本。
  • 任务特异性 – 在简单的抓取与放置任务上成功率飙升,但在需要精细对齐的任务上趋于平稳,表明当前 LLM 规划器缺乏复杂装配所需的精度。
  • 可扩展性问题 – 即使每次简单抓取与放置成本为 $1–$2,对大规模部署而言仍偏高;需要硬件进步或模型优化才能达到经济可行的水平。
  • 模块化流水线 – 实验凸显了将高层规划(LLM)与低层控制(IK)分离的价值,但也暗示了未来通过更紧密集成(如 VLM 到 VLA 架构)可能获得的收益。

对实践者的总结建议

  • 将 GPT‑6 Astra 用于 低复杂度的抓取与放置 任务,当速度和成本至关重要时,但 不要期望 其在无额外控制层的情况下处理精细插入。
  • 考虑开展 公共服务试点(如垃圾清理),以展示能力并收集真实世界数据。
  • 预期 成本下降,随着模型定价改善和缓存机制更加透明。
  • 关注 模块化机器人堆栈,将 LLM 规划器与专用低层控制器结合,以应对超出简单抓取的任务。

Sources

相关