GPT-6 Astra 機器人手臂基準測試:95% 成功率的方塊放置對比 Claude Fable 5.1 的 40%
底層性能表現
GPT‑6 Astra 在 20 次試驗中完成了「方塊放入碗中」任務 19 次(95% 成功率),每次運行僅耗費 $0.94,每次試驗耗時 2.5 分鐘,表現優於 Claude Fable 5.1(8/20,$2.12,6.8 分鐘)與 Claude Fable 5(1/20,$2.69,8.2 分鐘)。 在更複雜的「拼圖插入凹槽」任務中,Astra 與 Fable 5.1 同樣取得 2/20 的成功率,於最後插入步驟停滯。
碗任務的重要性
- 碗任務專注於基本的抓取與放置能力:抓取、提升、運輸與釋放。
- Astra 的平均階段分數為 3.95(滿分 4),顯示其穩定達成最終放置階段,而 Fable 5.1 平均為 2.40,Fable 5 僅為 1.30。
- Token 使用量大幅下降:Astra 每次運行僅使用約 2 k 的輸出 token,相較於 Fable 5 的約 13 k,轉化為更低的推論成本。
拼圖插入凹槽任務揭示限制
- 拼圖任務要求將圓形零件精確對齊至圓形凹槽,測試細緻的空間推理能力。
- Astra 與 Fable 5.1 的平均階段分別為 2.00 與 2.35,顯示兩者皆能接近凹槽,但無法完成插入。
- Astra 每次運行成本($1.36)仍低於 Fable 5.1($2.18),但成功率相同(10%)。
實驗設定
- 硬體:雙臂 I2RT YAM(每臂 6-DoF)搭配平行夾爪,透過三台相機(頂部、左腕、右腕)與本體感覺進行監控。
- 控制:將絕對末端執行器姿態(
move_to)輸入機器人的逆運動學求解器。 - 策略:使用 Inspect‑Robots 裝置(v0.58.0)中的
agent策略,中等推理努力程度,20 次 LLM 呼叫預算,以及 25 % 的速度上限。 - 試驗:每模型每任務進行 20 次運行;Astra 的碗任務在 rig‑1 上執行,Fable 模型在 rig‑3 上執行;所有模型的拼圖任務在 rig‑4 上執行。
- 評分:人工評分員為每次試驗分配階段(0–4);評分標準與先前的 Fable 報告一致。
成本與延遲分解
| 模型 | 任務 | 平均輸出 token 數 | 評估 $/運行 | 平均時間(分鐘) |
|---|---|---|---|---|
| GPT‑6 Astra | 碗 | 2.1 k | $0.94 | 2.5 |
| Claude Fable 5.1 | 碗 | 12.9 k | $2.12 | 6.8 |
| Claude Fable 5 | 碗 | 19.2 k | $2.69 | 8.2 |
| GPT‑6 Astra | 拼圖 | 2.7 k | $1.36 | 3.4 |
| Claude Fable 5.1 | 拼圖 | 10.5 k | $2.18 | 5.9 |
| Claude Fable 5 | 拼圖 | 16.3 k | $2.63 | 7.9 |
- 成本以定價($10 / M 輸入 token,$50 / M 輸出 token)計算,未考慮 OpenAI 的自動輸入快取,此快取將進一步降低 Astra 的實際成本。
社群見解(Hacker News)
@baron816 – 建議聚焦於公共利益機器人(例如人行道垃圾清理)作為早期市場,以展現價值並建立信任。
@gizmodo59 – 贊揚 Astra 在電腦使用任務上的速度與多功能性,指出 $200 的訂閱費物有所值。
@scronkfinkle – 質疑 LLM 何時能處理洗衣等日常家務,突顯令人印象深刻的示範與實際家庭自動化之間的差距。
@yurimo – 批評實驗範圍有限,指出過度依賴外部 IK 控制器,且未與端到端 VLA/WAM 架構進行比較。
@SillyUsername – 報告在小型開源機器人手臂上使用 Astra 的負面經驗,指稱成本較高且程式碼生成品質不佳。
@sheeshkebab – 總結結果為「以一歲孩童的水準半穩定地移動方塊」,強調進步雖小但真實存在。
需留意的限制
- 時間分離 – Astra 的運行比 Fable 運行晚兩天;環境變化可能影響表現。
- 設備不匹配 – Astra 的碗任務使用與 Fable 任務不同的實體設備,可能影響成功率。
- 人工評分偏見 – 評分員知道每次運行由哪個模型產生,可能導致無意識偏見。
- 成本膨脹 – 使用定價 token 成本;OpenAI 的快取可能使 Astra 的實際成本更低,而 Anthropic 的運行未受益於快取。
- 手動重置 – 各試驗間物件由人工重新定位,引入變異性。
- 推理努力程度 – 所有模型均以 中等 努力運作;更高努力設定可能改變結果。
這對 LLM 驅動機器人意味著什麼
- 效率提升 – Astra 的 token 效率提示與快速推論轉化為簡單操作的顯著更低每運行成本。
- 任務特異性 – 在簡單的抓取與放置任務上成功率大幅提升,但在需要精細對齊的任務上停滯,顯示目前 LLM 計畫器缺乏複雜組裝所需的精確度。
- 可擴展性疑慮 – 即使每次簡單抓取與放置成本為 $1–$2,對大規模部署而言仍偏高;需硬體進步或模型優化才能達到經濟可行的水準。
- 模組化流程 – 實驗強調將高階規劃(LLM)與低階控制(IK)分離的價值,但也暗示未來緊密整合(例如 VLM 至 VLA 架構)可能帶來更大進步。
對實務工作者的結論
- 將 GPT‑6 Astra 部署於 低複雜度的抓取與放置 任務中,當速度與成本至關重要時,但 不應期待 其在無額外控制層的情況下處理細緻插入。
- 考慮啟動 公共服務試點(例如垃圾清理),以展現能力並收集真實世界資料。
- 預期 成本下降,隨著模型定價改善與快取機制更透明化。
- 留意 模組化機器人堆疊,結合 LLM 計畫器與專用低階控制器,以處理超越簡單抓取的任務。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch