GPT-6 Astra ロボットアームベンチマーク:ブロック配置で95%の成功、Claude Fable 5.1の40%を上回る

ベースライン性能

GPT‑6 Astraは「ブロックをボウルに配置する」タスクを20試行中19試行で完了(95%成功)し、1回あたり$0.94、1試行あたり2.5分で実行。Claude Fable 5.1(8/20、$2.12、6.8分)とClaude Fable 5(1/20、$2.69、8.2分)を上回った。 より複雑な「パズルを溝に挿入する」タスクでは、AstraはFable 5.1と同じ2/20の成功率を達成し、最終挿入ステップで詰まった。


ボウルタスクの重要性

  • ボウルタスクは基本的なピックアンドプレース能力(把持、持ち上げ、輸送、離脱)を分離して評価する。
  • Astraの平均ステージスコアは3.95(4点満点)で、最終配置ステージに一貫して到達しているのに対し、Fable 5.1は平均2.40、Fable 5は1.30だった。
  • トークン使用量は劇的に低下:Astraは1回あたり約2 kの出力トークンを使用したのに対し、Fable 5は約13 kで、推論コストが低くなった。

パズルイングローブタスクが示す限界

  • パズルは円形の溝に円形の部品を正確に合わせる必要があり、細かい空間認識能力を試す。
  • AstraとFable 5.1の平均ステージはそれぞれ2.002.35で、溝に近づくことはできたが、挿入を完了できなかった。
  • Astraの1回あたりコスト($1.36)はFable 5.1($2.18)より低かったが、成功率は同じ(10%)だった。

実験設定

  • ハードウェア:バイマンアール I2RT YAM(各6自由度)と並行ジョイントグリッパー、3台のカメラ(上部、左腕、右腕)とプロピオセプションによる観測。
  • 制御:ロボットのIKソルバーに絶対的なエンドエフェクタ姿勢(move_to)を入力。
  • ポリシー:Inspect‑Robotsハーネス(v0.58.0)のagentポリシー、中程度の推論努力、20回のLLMコール予算、25 %の速度制限。
  • 試行:各モデル・各タスクで20回の実行。Astraのボウル試行はrig‑1で、Fableモデルはrig‑3で実施。パズル試行はすべてrig‑4で実施。
  • スコアリング:人間の評価者が各試行ごとにステージ(0–4)を付与。基準は以前のFableレポートと一致している。

コストとレイテンシの分解

モデル タスク 平均出力トークン数 推定$/run 平均時間(分)
GPT‑6 Astra ボウル 2.1 k $0.94 2.5
Claude Fable 5.1 ボウル 12.9 k $2.12 6.8
Claude Fable 5 ボウル 19.2 k $2.69 8.2
GPT‑6 Astra パズル 2.7 k $1.36 3.4
Claude Fable 5.1 パズル 10.5 k $2.18 5.9
Claude Fable 5 パズル 16.3 k $2.63 7.9
  • コストはリスト価格(1M入力トークンあたり$10、1M出力トークンあたり$50)で計算されており、OpenAIの自動入力キャッシュは考慮されていない。これによりAstraの実効コストはさらに低くなる可能性がある。

Hacker Newsからのコミュニティの知見

@baron816 – 公共的価値のあるロボット(例:歩道のゴミ収集)を早期市場として注目すべきだと提案。価値を示し、信頼を築くため。

@gizmodo59 – Astraのスピードと多用途性を高く評価。コンピュータ作業に適しており、$200のサブスクリプションは価値があると指摘。

@scronkfinkle – LLMが日常の家事(例:洗濯)を処理できるのはいつか?という疑問を提起。印象的なデモと実用的な家庭自動化の間にはギャップがあると強調。

@yurimo – 実験の範囲が限定的だと批判。外部のIKコントローラーに依存しており、エンドツーエンドのVLA/WAMアーキテクチャとの比較が欠けていると指摘。

@SillyUsername – 小規模なオープンソースロボットアームでAstraを使用した際、コストが高く、コード生成が不十分だったと報告。

@sheeshkebab – 結果を「1歳児レベルのブロック移動が半ば一貫して可能」と要約。小さな進歩だが、実際の進歩であると強調。


考慮すべき制限

  • 時間的分離 – Astraの実行はFableの実行から2日後に行われた。環境の変化が性能に影響を与える可能性がある。
  • リグの不一致 – Astraのボウル試行はFableの試行とは異なる物理的リグを使用しており、成功率に影響を与える可能性がある。
  • 人間の評価バイアス – 評価者はどのモデルが各実行を生成したかを知っていたため、無意識のバイアスが生じる可能性がある。
  • コストの上昇 – リスト価格のトークンコストを使用。OpenAIのキャッシュによりAstraの実コストはさらに低くなるが、Anthropicの実行にはキャッシュの恩恵が及ばなかった。
  • 手動リセット – 試行間で物体を手で再配置しており、ばらつきが生じた。
  • 推論努力 – すべてのモデルが中程度の努力で動作。より高い努力設定では結果が変わる可能性がある。

LLM駆動ロボティクスについての教訓

  • 効率性の向上 – Astraのトークン効率の良いプロンプティングと高速な推論により、簡単な操作の1回あたりコストが顕著に低下した。
  • タスクの特異性 – 単純なピックアンドプレースでは成功が高まるが、細かい合わせが必要なタスクでは成績が頭打ちになる。現行のLLMプランナーは複雑な組立に必要な精度を欠いていることを示している。
  • スケーラビリティの懸念 – 1回あたり$1–$2のコストでも、大規模展開には依然として高すぎる。経済的に実現可能な水準に達するには、ハードウェアの進化やモデル最適化が必要。
  • モジュール式パイプライン – 高レベルの計画(LLM)と低レベルの制御(IK)を分離する価値を実証したが、将来的にはより密接な統合(例:VLMからVLAへのアーキテクチャ)による利点も見込まれる。

実践者への結論

  • 速度とコストが重要な低複雑度のピックアンドプレースにはGPT‑6 Astraを導入すべきだが、細かい挿入作業は追加の制御レイヤーなしでは期待できない
  • 公共サービスのパイロット(例:ゴミ収集)を検討し、実力を示しながらリアルワールドデータを収集する。
  • モデル価格の改善とキャッシュの透明化により、コストの低下を予想できる。
  • LLMプランナーと専用の低レベルコントローラーを組み合わせたモジュール式ロボティクススタックに注目し、単純な把持を超えるタスクに対応する。

Sources

関連