GPT-5.1-Codex-Max 发布说明
OpenAI 已推出 GPT-5.1-Codex-Max,这是一种面向长时运行、复杂软件工程任务的前沿 agentic 编码模型。该模型基于在研究、数学和软件工程领域的 agentic 任务上训练的更新后的基础推理模型构建,使其能够充当更可靠的编码伙伴。
通过压缩实现的长时程编码
GPT-5.1-Codex-Max 引入了一种称为“压缩”(compaction)的原生流程,使模型能够跨多个上下文窗口运行。通过在长时程上修剪历史同时保留关键上下文,模型能够在单个任务中连贯地处理数百万个 token。
此能力使得:
- 项目级别重构:模型能够在不丢失进度的情况下处理代码库范围内的大规模更改。
- 深度调试会话:对复杂错误进行持续推理。
- 多小时 agent 循环:在内部评估中,模型能够独立工作超过 24 小时,持续迭代实现并修复测试失败。
在 Codex 应用中,当模型接近上下文窗口限制时,它会自动压缩其会话,提供一个全新的窗口以继续任务直至完成。
技术性能与 token 效率
GPT-5.1-Codex-Max 在 token 效率和速度上均优于其前身。在 SWE-bench Verified 基准测试中,该模型在使用“medium”推理强度的情况下,比 GPT-5.1-Codex 表现更佳,同时思考 token 消耗减少了 30%。
推理强度级别
- Medium:建议作为大多数任务的日常驱动。
- Extra High (xhigh):一个用于非延迟敏感任务的新设置,允许模型思考更长时间以获得更高质量的答案。
基准测试结果
| 基准测试 | GPT-5.1-Codex (high) | GPT-5.1-Codex-Max (xhigh) |
|---|---|---|
| SWE-bench Verified (n=500) | 73.7% | 77.9% |
| SWE-Lancer IC SWE | 66.3% | 79.9% |
| Terminal-Bench 2.0 | 52.8% | 58.1% |
agentic 能力与环境支持
GPT-5.1-Codex-Max 在真实世界的软件工程任务上进行了训练,包括 PR 创建、前端编码和代码审查。它是系列中首次专门在 Windows 环境下运行进行训练的模型,并在 Codex CLI 中包含了专门的协作训练。
安全与防护框架
尽管 GPT-5.1-Codex-Max 是 OpenAI 迄今为止部署的最强大的网络安全模型,但它在 OpenAI 的准备框架下未达到“High”能力。为降低风险,OpenAI 已实施以下措施:
- Secure Sandboxing:Codex 默认在安全沙箱中运行,限制文件写入工作区,除非开发者显式启用,否则禁用网络访问。
- Cybersecurity Monitoring:使用专门的监控来检测和阻断恶意活动,可疑活动将通过策略监控系统路由。
- Human-in-the-Loop:由于模型能够执行长时任务,OpenAI 建议开发者在部署到生产环境前审查所有 agent 工作——由终端日志和工具调用引用支持。
可用性与集成
GPT-5.1-Codex-Max 现在是 Codex 界面的默认模型,适用于 ChatGPT Plus、Pro、Business、Edu 和 Enterprise 计划的用户。它特别推荐用于 Codex 或类似环境中的 agentic 编码任务,而不是通用用途。
开发者通过 API key 使用 Codex CLI 的 API 访问预计将很快可用。