OpenAI GPT-6 Astra 在 ARC-AGI-3 基準測試中的表現
OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基準測試中取得了尖端(state-of-the-art)的結果,展現了代理智能(agentic intelligence)的重大飛躍。透過使用專門的 Provider Adapter harness,該模型在 Semi-Private 測試集中獲得了 99.9% 的分數,同時在 96% 的已完成關卡中,其動作效率超越了人類中位數基準。
ARC-AGI-3:衡量代理智能
ARC-AGI-3 是一個旨在衡量當前 AI 與通用人工智慧(AGI)之間「殘餘差距」(residual gap)的基準測試。與之前的版本不同,ARC-AGI-3 專注於在新型、抽象、回合制的環境中展現代理能力,在這些環境中,代理必須在沒有明確指令的情況下進行探索並解決謎題。
該基準測試評估了智能的四個主要組成部分:
- 探索(Exploration): 主動與環境互動以收集資訊。
- 建模(Modeling): 將原始觀察結果轉換為可廣義化的模型,以預測未來狀態。
- 目標設定(Goal-setting): 僅使用稀疏獎勵來識別目標狀態。
- 規劃與執行(Planning and Execution): 規劃通往目標的路徑並根據新數據進行修正。
GPT-6 Astra 的表現與成本
GPT-6 Astra 在不同的推理努力程度(reasoning effort levels)和 harness 配置下展現了高性能。結果顯示,較高的推理努力程度通常會導致較低的總成本,因為模型能以較少的動作解決遊戲,從而減少了所需的模型調用次數。
按 Harness 分類之表現
- Standard Harness: 這種中立於提供者的介面要求模型管理其自身的顯性筆記。在此配置下,Astra (max) 在 Semi-Private 集上的得分為 62.7%,成本為 $26,098。
- Provider Adapter Harness: 這種 harness 保留了請求之間的隱性推理狀態,並針對長對話使用壓縮技術。在此配置下,Astra (high) 獲得了 99.9% 的分數,成本為 $18,817。
推理努力程度比較
| Reasoning effort | Standard harness | Provider Adapter harness | | :--- | :--- | :--- | | | max | 62.7%, $26,098 | 98.6%, $17,332 | | xhigh | 59.3%, $37,317 | 98.4%, $18,147 | | high | 54.8%, $40,705 | 99.9%, $18,817 | | medium | 38.6%, $48,090 | 98.4%, $19,285 | | low | 17.5%, $38,166 | 98.0%, $21,298 | | none | 35.2%, $49,791 | 96.7%, $23,457 |
關鍵行為洞察
對 Astra 的回放進行分析後,揭示了三個有助於其高性能的獨特能力:
1. 自定義符號世界模型
Astra 開發了一種即時的代數簡寫來追蹤遊戲狀態並規劃動作。它並非使用完整的程式語言,而是創建了緊湊且資訊密度高的筆記來記錄座標、規則和序列。例如,它可能會將狀態記錄為 L8: hub q2 (8↓). Lengths: 14=1… 或將計劃作為 extend8 to3; retract10 to2; shorten8 to1。
2. 人類水平的動作效率
Astra (max) 使用 Provider Adapter harness 時,在 96.0% 的關卡中使用的動作比人類中位數更少,且平均每關所需的動作比人類少 51.7%。這表明一旦模型理解了環境的機理,它就能以匹配或超越人類表現的的效率來執行解決方案。
3. 自主工具創建
當在 PRO-LONG harness(提供程式碼執行沙盒)中進行評估時,Astra 創建了針對特定遊戲的自定義軟體庫。在一個迷宮類遊戲 (tu93) 中,Astra 開發了用於導航的 Python 腳本 (maze_solver.py)、用於戰鬥規則的 (combat_solver.py) 和用於巡邏建模的 (patrol_solver.py),並使用同步腳本 (sync_state.py) 來驗證預測與觀察結果是否一致。
討論與限制
雖然這些結果是一個重大里程碑,但 ARC Prize 團隊強調,達到該基準測試的飽和並不代表證明了 AGI。
Hacker News 上的社群群體討論突顯了幾個關鍵觀點:
"Is solving a snake like puzzle game in the least number of moves really what defines intelligence?"
"Was OpenAI able to run ARC-AGI-3 tests previously so that they could build a custom harness for the specific tests in the set?"
其他觀察者指出,與人類勞動力相比,這些運行的極端成本(每個謎題約 $360)非常高,儘管有人認為,如果價格-性能比的趨勢持續,AI 成本最終將會降至人類最低工資以下。
此外,外部數據表明,雖然 Astra 在 ARC-AGI-3 表現優異,但它在處理高度複雜的數學問題時仍然面臨挑戰。根據關於 FrontierMath-Erdos 基準測試的報告,GPT-6 Astra 僅解決了 68 個問題中的 5 個,其中一些解決方案所需的計算成本超過了 $220,000。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch