OpenAI GPT-5.6 發布:融合前沿智慧與效率

OpenAI 已推出 GPT-5.6 模型系列,旨在在廣泛的任務範圍內平衡高階能力與成本效益。旗艦模型 GPT-5.6 Sol 在人工分析編碼代理指數上表現優於 Claude Fable 5,而成本僅為其一半。該系列還包括 Terra,其智慧基準與 GPT-5.5 相同,但價格僅為其一半;以及 Luna,這是最快且最具成本效益的選項,價格比 Sol 低 80%。

每 token 智能效率

GPT-5.6 透過在訓練期間同時優化任務成功與效率,實現至今最高的每 token 智能效率。此方法使模型朝任務完成採取更直接的路徑,有效地提升每 token 的工作量。

推理堆疊優化

OpenAI 已優化其推理堆疊,以在不犧牲延遲、可靠性或智能的情況下,使用相同硬體提供更多 token。這些改進主要源於在 Codex 中使用 GPT-5.6 Sol 來自行優化系統。

負載平衡與路由

在 Codex 中的 GPT-5.6 Sol 被用來分析生產流量並調整路由請求的啟發式規則。這包括根據地理位置與容量優化請求的全球分布方式,以及在加速器與運算核心的叢集與實例內如何分割請求。

核心優化與 GPU 效能

為減少因記憶體移動與低效資料佈局導致的 GPU 閒置時間,GPT-5.6 Sol 自行重寫並優化了生產核心。使用開源 GPU 編程語言 Triton 與 Gluon,這些核心進步使端到端服務成本降低了 20%。OpenAI 利用開源浮點清理器(FpSan)驗證這些 AI 生成核心的正確性。

投機解碼

透過改進投機解碼,令牌生成效率提升超過 15%。GPT-5.6 Sol 為其自身的草案(投機者)模型設計並測試了數百種架構實驗,並自行管理訓練過程,在硬體故障或不穩定時進行干預。

工作負載特定配置

透過在 Codex 中使用 GPT-5.6 Sol,OpenAI 從廣泛的啟發式規則過渡到推理引擎的超優化配置。透過分析生產工作負載,系統現在會根據特定的提示與輸出長度以及查詢特性,優化批次處理、分片及 KV 快取管理。

代理 harness 與編排

ChatGPT Work 與 Codex 使用一種基於 Rust 的編排層,稱為代理 harness,以管理涉及多個模型請求與工具呼叫的複雜任務。該 harness 專注於減少重複工作以提升整體效能。

減少內容膨脹

該 harness 採用延遲發現機制,確保僅在必要時才顯示整合、自訂 MCP 工具與外掛。為防止非預期的內容視窗消耗,工具輸出預設上限為 10,000 個 token,除非模型明確請求不同的限制。

提示快取與前綴保存

為最大化提示快取命中率,該 harness 將所有模型可見的歷史視為僅追加,將新訊息與工具結果添加到內容末尾而非插入。此外,工具會以確定性順序呈現,執行時套用運行時設定而非嵌入工具定義中,以確保提示前綴保持精確且可重複使用。

Sources