OpenAI GPT-6 Astra Performance on ARC-AGI-3 Benchmark
OpenAIのGPT-6 Astraは、ARC-AGI-3ベンチマークで最先端の結果を達成し、エージェント知能における大幅な飛躍を示しました。特化したProvider Adapterハーネスを使用して、モデルはSemi-Privateテストセットで99.9%のスコアに達し、同時に完了したレベルの96%でアクション効率において人間のベースラインの中央値を上回りました。
ARC-AGI-3: エージェント知能の測定
ARC-AGI-3は、現在のAIと汎用人工知能(AGI)との間の「残差ギャップ」を測定するために設計されたベンチマークです。以前の反復とは異なり、ARC-AGI-3は、エージェントが明示的な指示なしにパズルを探索して解決する必要がある、斬新で抽象的なターン制環境におけるエージェント能力に焦点を当てています。
このベンチマークは、知能の4つの主要な構成要素を評価します:
- 探索: 積極的に環境と相互作用して情報を収集すること。
- モデリング: 生の観察を一般化可能なモデルに変換して将来の状態を予測すること。
- 目標設定: スパースな報酬のみを使用して目標状態を特定すること。
- 計画と実行: 目標までの道筋をマッピングし、新しいデータに基づいて軌道を修正すること。
GPT-6 Astraのパフォーマンスとコスト
GPT-6 Astraは、異なる推論努力レベルとハーネス構成全体にわたって高いパフォーマンスを示しました。結果は、より高い推論努力が総コストの削減につながることが多いことを示しています。これは、モデルがより少ないアクションでゲームを解決し、必要なモデル呼び出しの回数を減らすためです。
ハーネス別のパフォーマンス
- Standard Harness: このプロバイダ中立なインターフェースは、モデルが自身の可視メモを管理することを要求します。この構成では、Astra (max) はSemi-Privateセットで62.7%のスコアを獲得し、コストは$26,098でした。
- Provider Adapter Harness: このハーネスはリクエスト間で不透明な推論状態を保持し、長い会話には圧縮を使用します。この構成では、Astra (high) は99.9%のスコアを達成し、コストは$18,817でした。
推論努力の比較
| 推論努力 | Standard harness | Provider Adapter harness |
|---|---|---|
| max | 62.7%, $26,098 | 98.6%, $17,332 |
| xhigh | 59.3%, $37,317 | 98.4%, $18,147 |
| high | 54.8%, $40,705 | 99.9%, $18,817 |
| medium | 38.6%, $48,090 | 98.4%, $19,285 |
| low | 17.5%, $38,166 | 98.0%, $21,298 |
| none | 35.2%, $49,791 | 96.7%, $23,457 |
主要な行動的洞察
Astraのリプレイの分析は、その高いパフォーマンスに貢献する3つの明確な能力を明らかにしました:
1. カスタム記号世界モデル
Astraは、ゲーム状態を追跡しアクションを計画するためのオンザフライの代数的速記法を開発します。完全なプログラミング言語を使用する代わりに、コンパクトで情報密度の高いメモを作成して、座標、ルール、シーケンスを記録します。例えば、状態を L8: hub q2 (8↓). Lengths: 14=1… として記録したり、計画を extend8 to3; retract10 to2; shorten8 to1 として記録したりします。
2. 人間レベルのアクション効率
Provider Adapterハーネスを使用したAstra (max) は、96.0%のレベルで中央値の人間よりも少ないアクションを使用し、レベルあたりの平均アクション数が51.7%少なくなりました。これは、モデルが環境のメカニクスを理解すると、人間のパフォーマンスに匹敵するかそれを超える効率でソリューションを実行することを示しています。
3. 自律的なツール作成
コード実行サンドボックスを提供するPRO-LONGハーネスで評価された際、Astraは特定のゲーム向けのカスタムソフトウェアライブラリを作成しました。迷路のようなゲーム(tu93)では、Astraはナビゲーション(maze_solver.py)、戦闘ルール(combat_solver.py)、および巡回モデリング(patrol_solver.py)用に個別のPythonスクリプトを開発し、同期スクリプト(sync_state.py)を使用して観察に対する予測を検証しました。
議論と制限事項
結果は大きなマイルストーンですが、ARC Prizeチームは、このベンチマークを飽和させることがAGIの証明を構成するものではないと強調しています。環境は決定論的でクローズエンドであり、現実世界のオープンエンドな複雑さを反映していません。
Hacker Newsでのコミュニティの議論では、いくつかの重要な視点が強調されました:
「最小の手数でスネークのようなパズルゲームを解くことは、本当に知能を定義するものなのでしょうか?」
「OpenAIは以前にARC-AGI-3テストを実行して、セット内の特定のテスト用にカスタムハーネスを構築できたのでしょうか?」
他の観察者は、人間の労働と比較してこれらの実行の極端なコスト(パズルあたり約$360)を指摘しましたが、価格性能のトレンドが続けば、最終的にAIのコストが人間の最低賃金を下回るだろうと主張する人もいました。
さらに、外部データは、AstraがARC-AGI-3で優れている一方で、非常に複雑な数学的問題にはまだ苦労していることを示唆しています。FrontierMath-Erdosベンチマークに関する報告によると、GPT-6 Astraは68問中5問しか解決できず、一部のソリューションには$220,000を超える計算コストが必要でした。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch