GPT-5.1-Codex-Max 系統卡

OpenAI 已推出 GPT-5.1-Codex-Max,這是一種專為複雜軟體工程、數學和研究任務設計的前沿具代理能力的編碼模型。該模型透過稱為壓縮(compaction)的流程,能夠在多個上下文視窗中運行,使其能在單一任務中保持數百萬個標記的一致性。

模型架構與訓練

GPT-5.1-Codex-Max 建構在 OpenAI 基礎推理模型的更新版本上。它經過原生訓練,以處理軟體工程、醫學和電腦使用等多個領域的代理任務。為了優化其在真實世界軟體工程工作流程上的表現,該模型在請求拉取(PR)建立、程式碼審查、前端編碼和技術問答等任務上進行了訓練。

安全與緩解策略

OpenAI 已實施一套全面的安全措施,以防止濫用和漏洞。這些緩解措施分為兩個主要類別:

模型級緩解措施

模型級保護包括專門的安全訓練,特別針對防止模型執行有害任務和抵抗提示注入。

產品級緩解措施

產品級保護包括代理沙盒和可配置的網路存取,以確保模型的代理能力在受控環境中執行。

準備框架評估

GPT-5.1-Codex-Max 使用 OpenAI 的準備框架進行了評估,以評估其潛在風險。結果如下:

  • Cybersecurity: 該模型在網路安全領域被描述為非常強大,但目前尚未達到「高」能力門檻。OpenAI 預期,隨著能力持續提升,未來模型很可能會跨越此門檻。
  • Biology: 該模型被視為在生物學領域具備「高」能力,因此將使用與 GPT-5 相同的防護措施進行部署。
  • AI Self-Improvement: 該模型未達到 AI 自我改進的「高」能力門檻。

Sources