GPT-5.1-Codex-Max 發布說明
OpenAI 已推出 GPT-5.1-Codex-Max,這是一種專為長時間運行、複雜的軟體工程任務設計的前沿 agentic 編碼模型。此模型建構於一個更新的基礎推理模型之上,該模型在研究、數學和軟體工程領域的 agentic 任務上進行訓練,使其能夠成為更可靠的編碼夥伴。
透過壓縮進行長時程編碼
GPT-5.1-Codex-Max 引入了一種名為 "compaction" 的原生流程,使模型能夠跨多個上下文視窗運行。透過在長時程內修剪歷史同時保留關鍵上下文,模型能夠在單一任務中連貫地處理數百萬個 token。
此能力使得:
- Project-scale refactors:模型能夠在不遺失進度的情況下處理代碼庫範圍內的大規模變更。
- Deep debugging sessions:對複雜錯誤進行持續推理。
- Multi-hour agent loops:在內部評估中,模型能夠獨立處理任務超過 24 小時,持續迭代實現並修復測試失敗。
在 Codex 應用中,模型在接近上下文視窗限制時會自動壓縮其會話,提供一個新的視窗以繼續任務直至完成。
技術效能與 token 效率
GPT-5.1-Codex-Max 比其前身更具 token 效率且速度更快。在 SWE-bench Verified 基準測試中,該模型在使用「medium」推理力度時,表現優於 GPT-5.1-Codex,同時思考 token 消耗減少 30%。
推理力度等級
- Medium:建議作為大多數任務的日常驅動。
- Extra High (xhigh):一個新設定,用於非延遲敏感的任務,允許模型延長思考時間以獲得更高品質的答案。
基準測試結果
| 基準測試 | GPT-5.1-Codex (high) | GPT-5.1-Codex-Max (xhigh) |
|---|---|---|
| SWE-bench Verified (n=500) | 73.7% | 77.9% |
| SWE-Lancer IC SWE | 66.3% | 79.9% |
| Terminal-Bench 2.0 | 52.8% | 58.1% |
agentic 能力與環境支援
GPT-5.1-Codex-Max 在真實世界的軟體工程任務上進行訓練,包括 PR 建立、前端編碼和程式碼審查。該模型是該系列中首個專門在 Windows 環境下運行的訓練模型,並包含了專門的訓練以在 Codex CLI 中提升協作。
安全與防護框架
儘管 GPT-5.1-Codex-Max 是 OpenAI 迄今為止部署的最強網路安全模型,但它在 OpenAI 的 Preparedness Framework 下未達到「High」能力。為降低風險,OpenAI 已實施以下措施:
- Secure Sandboxing:Codex 預設在安全沙盒中運行,限制工作區的檔案寫入,除非開發者明確啟用,否則禁用網路存取。
- Cybersecurity Monitoring:使用專門的監控來偵測並阻斷惡意活動,可疑活動會透過政策監控系統進行路由。
- Human-in-the-Loop:因為模型能夠執行長時間運行的任務,OpenAI 建議開發者在部署到生產環境前,檢閱所有 agent 工作——以終端日誌和工具調用引用為支撐。
可用性與整合
GPT-5.1-Codex-Max 現在是 Codex 介面的預設模型,且可供 ChatGPT Plus、Pro、Business、Edu 和 Enterprise 方案的使用者使用。該模型特別建議用於 Codex 或類似環境中的 agentic 編碼任務,而非一般用途。
透過 API key 使用 Codex CLI 的開發者預計不久將可獲得 API 存取權。