GPT-6 Astra 机械臂基准测试:95% 成功率的积木放置 vs. Claude Fable 5.1 的 40%
底线性能
GPT‑6 Astra 在 20 次试验中完成了 19 次「积木放入碗中」任务(95% 成功率),每次运行仅耗资 $0.94,每次试验耗时 2.5 分钟,优于 Claude Fable 5.1(8/20,$2.12,6.8 分钟)和 Claude Fable 5(1/20,$2.69,8.2 分钟)。 在更复杂的「拼图插入凹槽」任务中,Astra 与 Fable 5.1 一样,成功率均为 2/20,均在最后插入步骤卡住。
为何碗任务至关重要
- 碗任务隔离了基本的抓取与放置能力:抓取、提升、运输和释放。
- Astra 的平均阶段得分为 3.95(满分 4),表明其能稳定到达最终放置阶段,而 Fable 5.1 平均为 2.40,Fable 5 仅为 1.30。
- Token 使用量大幅下降:Astra 每次运行约使用 2 k 输出 Token,而 Fable 5 约为 13 k,这意味着更低的推理成本。
拼图插入凹槽任务揭示了局限性
- 该任务要求将圆形部件精确对齐至圆形凹槽,测试精细的空间推理能力。
- Astra 和 Fable 5.1 的平均阶段分别为 2.00 和 2.35,表明它们能接近凹槽但未能完成插入。
- Astra 每次运行成本($1.36)仍低于 Fable 5.1($2.18),但成功率相同(10%)。
实验设置
- 硬件:双臂 I2RT YAM 机械臂(每臂 6 自由度),配备平行爪夹持器,通过三台摄像头(顶部、左腕、右腕)加本体感知进行观察。
- 控制:将绝对末端执行器位姿(
move_to)输入机器人 IK 求解器。 - 策略:使用 Inspect‑Robots 框架(v0.58.0)中的
agent策略,中等推理努力,20 次 LLM 调用预算,25 % 速度限制。 - 试验:每模型每任务 20 次运行;Astra 的碗任务在 rig‑1 上进行,Fable 模型在 rig‑3 上进行;所有模型的拼图任务在 rig‑4 上进行。
- 评分:人工评分员为每次试验分配阶段(0–4);评分标准与之前的 Fable 报告一致。
成本与延迟分解
| 模型 | 任务 | 平均输出 Token 数 | 估算 $/运行 | 平均时间(分钟) |
|---|---|---|---|---|
| GPT‑6 Astra | 碗 | 2.1 k | $0.94 | 2.5 |
| Claude Fable 5.1 | 碗 | 12.9 k | $2.12 | 6.8 |
| Claude Fable 5 | 碗 | 19.2 k | $2.69 | 8.2 |
| GPT‑6 Astra | 拼图 | 2.7 k | $1.36 | 3.4 |
| Claude Fable 5.1 | 拼图 | 10.5 k | $2.18 | 5.9 |
| Claude Fable 5 | 拼图 | 16.3 k | $2.63 | 7.9 |
- 成本按列表价格计算($10 / M 输入 Token,$50 / M 输出 Token),未考虑 OpenAI 的自动输入缓存,这将进一步降低 Astra 的实际成本。
Hacker News 社区见解
@baron816 – 建议将重点放在公共利益型机器人(如人行道垃圾清理)上,作为早期市场以展示价值并建立信任。
@gizmodo59 – 赞扬 Astra 在计算机使用任务中的速度和多功能性,认为 200 美元订阅费物有所值。
@scronkfinkle – 质疑 LLM 何时能处理洗衣等日常家务,指出令人印象深刻的演示与实际家庭自动化之间存在差距。
@yurimo – 批评实验范围有限,指出对外部 IK 控制器的依赖以及未与端到端 VLA/WAM 架构进行比较。
@SillyUsername – 报告在小型开源机械臂上使用 Astra 的负面体验,称其成本更高且代码生成质量差。
@sheeshkebab – 将结果总结为「半稳定地以一岁儿童水平移动积木」,强调了虽小但真实的技术进步。
需要注意的局限性
- 时间分离 – Astra 的运行比 Fable 运行晚了两天;环境变化可能影响性能。
- 设备不匹配 – Astra 的碗任务使用了与 Fable 试验不同的物理设备,可能影响成功率。
- 人工评分偏见 – 评分员知道每项运行由哪个模型生成,存在无意识偏见的可能性。
- 成本通胀 – 使用了列表价格 Token 成本;OpenAI 的缓存可能使 Astra 的真实成本更低,而 Anthropic 的运行未受益于缓存。
- 手动重置 – 试验之间通过人工重新定位物体,引入了变异性。
- 推理努力 – 所有模型均以 中等 努力运行;更高努力设置可能改变结果。
这对 LLM 驱动的机器人意味着什么
- 效率提升 – Astra 的 Token 高效提示和更快的推理转化为简单操作的显著更低的单次运行成本。
- 任务特异性 – 在简单的抓取与放置任务上成功率飙升,但在需要精细对齐的任务上趋于平稳,表明当前 LLM 规划器缺乏复杂装配所需的精度。
- 可扩展性问题 – 即使每次简单抓取与放置成本为 $1–$2,对大规模部署而言仍偏高;需要硬件进步或模型优化才能达到经济可行的水平。
- 模块化流水线 – 实验凸显了将高层规划(LLM)与低层控制(IK)分离的价值,但也暗示了未来通过更紧密集成(如 VLM 到 VLA 架构)可能获得的收益。
对实践者的总结建议
- 将 GPT‑6 Astra 用于 低复杂度的抓取与放置 任务,当速度和成本至关重要时,但 不要期望 其在无额外控制层的情况下处理精细插入。
- 考虑开展 公共服务试点(如垃圾清理),以展示能力并收集真实世界数据。
- 预期 成本下降,随着模型定价改善和缓存机制更加透明。
- 关注 模块化机器人堆栈,将 LLM 规划器与专用低层控制器结合,以应对超出简单抓取的任务。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch