GPT-5.1-Codex-Max 发布说明

OpenAI 已推出 GPT-5.1-Codex-Max,这是一种面向长时运行、复杂软件工程任务的前沿 agentic 编码模型。该模型基于在研究、数学和软件工程领域的 agentic 任务上训练的更新后的基础推理模型构建,使其能够充当更可靠的编码伙伴。

通过压缩实现的长时程编码

GPT-5.1-Codex-Max 引入了一种称为“压缩”(compaction)的原生流程,使模型能够跨多个上下文窗口运行。通过在长时程上修剪历史同时保留关键上下文,模型能够在单个任务中连贯地处理数百万个 token。

此能力使得:

  • 项目级别重构:模型能够在不丢失进度的情况下处理代码库范围内的大规模更改。
  • 深度调试会话:对复杂错误进行持续推理。
  • 多小时 agent 循环:在内部评估中,模型能够独立工作超过 24 小时,持续迭代实现并修复测试失败。

在 Codex 应用中,当模型接近上下文窗口限制时,它会自动压缩其会话,提供一个全新的窗口以继续任务直至完成。

技术性能与 token 效率

GPT-5.1-Codex-Max 在 token 效率和速度上均优于其前身。在 SWE-bench Verified 基准测试中,该模型在使用“medium”推理强度的情况下,比 GPT-5.1-Codex 表现更佳,同时思考 token 消耗减少了 30%。

推理强度级别

  • Medium:建议作为大多数任务的日常驱动。
  • Extra High (xhigh):一个用于非延迟敏感任务的新设置,允许模型思考更长时间以获得更高质量的答案。

基准测试结果

基准测试 GPT-5.1-Codex (high) GPT-5.1-Codex-Max (xhigh)
SWE-bench Verified (n=500) 73.7% 77.9%
SWE-Lancer IC SWE 66.3% 79.9%
Terminal-Bench 2.0 52.8% 58.1%

agentic 能力与环境支持

GPT-5.1-Codex-Max 在真实世界的软件工程任务上进行了训练,包括 PR 创建、前端编码和代码审查。它是系列中首次专门在 Windows 环境下运行进行训练的模型,并在 Codex CLI 中包含了专门的协作训练。

安全与防护框架

尽管 GPT-5.1-Codex-Max 是 OpenAI 迄今为止部署的最强大的网络安全模型,但它在 OpenAI 的准备框架下未达到“High”能力。为降低风险,OpenAI 已实施以下措施:

  • Secure Sandboxing:Codex 默认在安全沙箱中运行,限制文件写入工作区,除非开发者显式启用,否则禁用网络访问。
  • Cybersecurity Monitoring:使用专门的监控来检测和阻断恶意活动,可疑活动将通过策略监控系统路由。
  • Human-in-the-Loop:由于模型能够执行长时任务,OpenAI 建议开发者在部署到生产环境前审查所有 agent 工作——由终端日志和工具调用引用支持。

可用性与集成

GPT-5.1-Codex-Max 现在是 Codex 界面的默认模型,适用于 ChatGPT Plus、Pro、Business、Edu 和 Enterprise 计划的用户。它特别推荐用于 Codex 或类似环境中的 agentic 编码任务,而不是通用用途。

开发者通过 API key 使用 Codex CLI 的 API 访问预计将很快可用。

Sources