GPT-5.6 發佈說明:提升代理效能價格比

OpenAI 已推出 GPT-5.6 模型系列,旨在讓尖端等級的代理效能更具負擔能力,同時擴展自主代理的能力。此次發佈的重點在於提高價格效能效率,讓開發者在降低 token 支出與營運成本的同時,維持高準確度。

增強的價格效能與模型選擇

與前幾代相比,GPT-5.6 在較低的推理努力程度下提供更高的準確度。在 Agents’ Last Exam 基準測試中的測試結果顯示,在相同的測試框架下,GPT-5.6 Sol 在「低」推理努力程度下的表現優於 GPT-5.5 在「高」推理努力程度下的表現。

開發者現在可以透過利用增加的測試時運算量(test-time compute),使用 5.6 系列中更具成本優化能力的模型(例如 Luna 和 Terra)來達到旗艦級的效能。這種轉變可以從 BrowseComp 搜尋型基準測試中得到證實:

  • GPT-5.5 (Extra High): 獲得 84.36% 的分數,成本為 $33.27。
  • GPT-5.6 Luna (Extra High): 獲得 84.04% 的分數,成本為 $1.33。

對於高容量工作負載、延遲敏感型互動,以及代理工作流中的重複性步驟(例如從手寫備忘錄中提取數據),特別推薦使用 Luna 和 Terra 等較小模型。

針對代理架構的 Responses API 更新

OpenAI 已更新 Responses API,透過三項架構干預措施來提高代理效率:

1. 推理持久性與壓縮

GPT-5.6 允許推理過程在模型輪次之間持久化,並利用原生壓縮功能來壓縮長時間運行的對話。這些功能可防止模型在長任務週期內失去連貫性,或需要重新構建上下文。在 ARC-AGI-3 基準測試中,啟用保留推理與壓縮功能後,GPT-5.6 Sol 的分數從 13.3% 提升至 38.3%,同時使用的輸出 token 數量減少了約 6 個。

2. 原生多代理協作 (Multi-Agent Orchestration)

Responses API 現在支援原生多代理協作,允許主代理將任務委派給並行工作的子代理。這種將推理分配到並行工作流中的方式,可以提高任務完成速度與整體智慧程度。這種協作機制也是 ChatGPT 中「ultra」功能設定的基礎。

3. 程式化工具調用 (Programmatic Tool Calling)

為了減少「上下文腐化」(context rot)並降低成本,程式化工具調用允許 GPT-5.6 撰寫 JavaScript 來協調工具並在模型上下文窗口之外處理輸出(例如過濾或聚合數據)。這保留了模型 token 於需要判斷力的任務中,而非用於確定性的數據處理。

Prompt Caching 改進

OpenAI 已將 prompt cache 的生存時間 (TTL) 延長至至少 30 分鐘。此外,開發者現在可以在模型的上下文窗口內確定性地設置快取斷點,以提高快取命中率。建議使用 prompt_cache_key 以增加請求落在同一個推理引擎上的可能性,從而降低延遲。

Sources

相關