GPT-5.1-Codex-Max 系统卡

OpenAI 介绍了 GPT-5.1-Codex-Max,这是一种专为复杂软件工程、数学和研究任务设计的前沿代理型编码模型。该模型通过称为压缩(compaction)的过程在多个上下文窗口之间进行操作,使其能够在单个任务中保持数百万 token 的连贯性。

模型架构与训练

GPT-5.1-Codex-Max 建立在 OpenAI 基础推理模型的更新之上。它经过原生训练,以处理软件工程、医学和计算机使用等多个领域的代理型任务。为了优化其在实际软件工程工作流程中的表现,该模型在诸如拉取请求(PR)创建、代码审查、前端编码和技术问答等任务上进行了训练。

安全与缓解策略

OpenAI 已实施一套全面的安全措施,以防止滥用和漏洞。这些缓解措施分为两大类:

模型级缓解措施

模型级保护包括专门的安全训练,旨在防止模型执行有害任务并抵御提示注入。

产品级缓解措施

产品级防护包括代理沙箱和可配置的网络访问,以确保模型的代理型能力在受控环境中执行。

准备框架评估

GPT-5.1-Codex-Max 使用 OpenAI 的准备框架进行了评估,以评估其潜在风险。结果如下:

  • Cybersecurity: 该模型在网络安全领域被描述为非常强大,但目前尚未达到“高”能力阈值。OpenAI 预计,随着能力的持续提升,未来的模型很可能会跨越此阈值。
  • Biology: 该模型在生物学领域被视为具有“高”能力,因此部署时使用了与 GPT-5 相同的防护措施。
  • AI Self-Improvement: 该模型未达到 AI 自我改进的“高”能力阈值。

Sources