OpenAI GPT-5.6 Sol ARC-AGI-3 基準測試效能最佳化
OpenAI 已經展示,透過啟用兩個特定的 API 設定:保留推理和壓縮,GPT-5.6 Sol 在 ARC-AGI-3 基準測試上的表現從 13.3% 提升至 38.3%。此發現凸顯基準分數常反映評估套件的配置,而非模型固有能力。
ARC-AGI-3 的效能提升
當使用啟用保留推理和壓縮的 Responses API 驅動的評估套件時,GPT-5.6 Sol 在 ARC-AGI-3 公共集上獲得了 38.3% 的分數。相較之下,官方 ARC-AGI-3 評估套件的分數為 13.3%。
這些分數是透過 Relative Human Action Efficiency (RHAE) 來測量的,該指標將模型表現與人類基準進行比較。為提供背景,OpenAI 估計平均人類測試者在相同任務上的得分為 48%。此提升代表效能幾乎提升了三倍,同時輸出 token 數減少了 6 倍。
評估套件設計對模型推理的影響
官方 ARC-AGI-3 評估套件採用通用設計,以使模型的不足更加顯眼並確保公平比較。然而,OpenAI 在此評估套件中發現了兩個主要限制,這些限制阻礙了 GPT-5.6 Sol 在 2D 拼圖遊戲中的學習與推理能力:
已捨棄的推理
在官方評估套件中,所有私人推理在每個遊戲動作後都被捨棄。這迫使模型在每回合都必須從頭重新解讀遊戲狀態,因為它無法存取導致先前動作的計畫、洞見或思考。
滾動截斷
為管理內容限制,官方評估套件採用滾動截斷,當對話超過 175,000 個字元時,會捨棄最舊的訊息。這會導致模型遺失其最早觀察和動作的記憶,並且因為保持內容視窗持續滿載而可能損害效能。
技術解決方案:保留推理與壓縮
為使評估與模型在 ChatGPT 和 Codex 中的部署方式保持一致,OpenAI 使用 Responses API 實作了一個評估套件。此方法引入了兩項關鍵的技術改進:
保留推理
透過在 Responses API 中傳遞先前的回應 ID,GPT-5.6 Sol 會自動在工具呼叫和回合間保留其私人推理。這使模型能夠隨時間採用連貫的策略,並減少每次動作前思考所花費的時間,因為它不再需要從每回合的開頭重新分析遊戲。
壓縮
將滾動截斷替換為壓縮,使模型能在較長的運行中更好地保留學習到的資訊。與僅刪除舊資料的滾動截斷不同,壓縮能更有效地管理內容,使模型在較少的輸出 token 情況下仍能維持較高的分數。
給 API 開發者的建議
OpenAI 建議尋求最大化模型效能的開發者應採用其生產環境中使用的設定。具體來說,他們建議:
- 使用 Responses API 而非傳統的 Chat Completions API。
- 保留推理 以讓模型在互動間保持邏輯連續性。
- 使用壓縮 以管理內容視窗而不遺失關鍵的早期回合資訊。