GPT-5.1-Codex-Max 發布說明

OpenAI 已推出 GPT-5.1-Codex-Max,這是一種專為長時間運行、複雜的軟體工程任務設計的前沿 agentic 編碼模型。此模型建構於一個更新的基礎推理模型之上,該模型在研究、數學和軟體工程領域的 agentic 任務上進行訓練,使其能夠成為更可靠的編碼夥伴。

透過壓縮進行長時程編碼

GPT-5.1-Codex-Max 引入了一種名為 "compaction" 的原生流程,使模型能夠跨多個上下文視窗運行。透過在長時程內修剪歷史同時保留關鍵上下文,模型能夠在單一任務中連貫地處理數百萬個 token。

此能力使得:

  • Project-scale refactors:模型能夠在不遺失進度的情況下處理代碼庫範圍內的大規模變更。
  • Deep debugging sessions:對複雜錯誤進行持續推理。
  • Multi-hour agent loops:在內部評估中,模型能夠獨立處理任務超過 24 小時,持續迭代實現並修復測試失敗。

在 Codex 應用中,模型在接近上下文視窗限制時會自動壓縮其會話,提供一個新的視窗以繼續任務直至完成。

技術效能與 token 效率

GPT-5.1-Codex-Max 比其前身更具 token 效率且速度更快。在 SWE-bench Verified 基準測試中,該模型在使用「medium」推理力度時,表現優於 GPT-5.1-Codex,同時思考 token 消耗減少 30%。

推理力度等級

  • Medium:建議作為大多數任務的日常驅動。
  • Extra High (xhigh):一個新設定,用於非延遲敏感的任務,允許模型延長思考時間以獲得更高品質的答案。

基準測試結果

基準測試 GPT-5.1-Codex (high) GPT-5.1-Codex-Max (xhigh)
SWE-bench Verified (n=500) 73.7% 77.9%
SWE-Lancer IC SWE 66.3% 79.9%
Terminal-Bench 2.0 52.8% 58.1%

agentic 能力與環境支援

GPT-5.1-Codex-Max 在真實世界的軟體工程任務上進行訓練,包括 PR 建立、前端編碼和程式碼審查。該模型是該系列中首個專門在 Windows 環境下運行的訓練模型,並包含了專門的訓練以在 Codex CLI 中提升協作。

安全與防護框架

儘管 GPT-5.1-Codex-Max 是 OpenAI 迄今為止部署的最強網路安全模型,但它在 OpenAI 的 Preparedness Framework 下未達到「High」能力。為降低風險,OpenAI 已實施以下措施:

  • Secure Sandboxing:Codex 預設在安全沙盒中運行,限制工作區的檔案寫入,除非開發者明確啟用,否則禁用網路存取。
  • Cybersecurity Monitoring:使用專門的監控來偵測並阻斷惡意活動,可疑活動會透過政策監控系統進行路由。
  • Human-in-the-Loop:因為模型能夠執行長時間運行的任務,OpenAI 建議開發者在部署到生產環境前,檢閱所有 agent 工作——以終端日誌和工具調用引用為支撐。

可用性與整合

GPT-5.1-Codex-Max 現在是 Codex 介面的預設模型,且可供 ChatGPT Plus、Pro、Business、Edu 和 Enterprise 方案的使用者使用。該模型特別建議用於 Codex 或類似環境中的 agentic 編碼任務,而非一般用途。

透過 API key 使用 Codex CLI 的開發者預計不久將可獲得 API 存取權。

Sources