GPT-5.3-Codex 发布说明 / 新功能
OpenAI 推出了 GPT-5.3-Codex,这是一款高能力的代理式编码模型,旨在处理涉及研究、工具使用和复杂执行的长期任务。该模型将 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业知识相结合,运行速度比前代提升 25%。
前沿代理能力
GPT-5.3-Codex 在编码和计算机使用任务上树立了新的行业基准,超越了单纯的代码生成,实现了自主执行。
软件工程与终端技能
GPT-5.3-Codex 在 SWE-Bench Pro(真实软件工程的多语言评估)上达到了业界领先水平,并在 Terminal-Bench 2.0 上显著超越了之前的表现。值得注意的是,模型使用的 token 数量少于之前的模型,为用户提升了效率。
Web 开发与迭代设计
该模型展示了从零构建复杂、可运行的游戏和应用的高级能力。在内部测试中,GPT-5.3-Codex 使用数百万 token,凭借诸如“修复 bug”或“改进游戏”等通用后续提示,独立迭代了赛车游戏和潜水游戏。
此外,模型在日常网站创建的意图理解上有所提升。例如,当要求为 “Quiet KPI” 构建登录页时,GPT-5.3-Codex 自动实现了生产就绪的功能——如年度计划的折扣月付价以及可切换的推荐语轮播,这些在 GPT-5.2-Codex 中均未出现。
通用专业知识工作
GPT-5.3-Codex 支持完整的软件生命周期,包括调试、部署、监控、撰写 PRD 与用户调研。其能力还延伸至通用知识工作,在 GDPval 基准上与 GPT-5.2 持平,该基准衡量 44 种职业的表现,包括制作电子表格和演示文稿。
在计算机使用能力方面,GPT-5.3-Codex 在 OSWorld-Verified 基准上实现了显著跃升,该基准要求代理在可视化桌面环境中使用视觉完成生产力任务。
自我改进开发周期
GPT-5.3-Codex 是首个在自身创建过程中发挥关键作用的 OpenAI 模型。Codex 团队利用模型的早期版本完成了以下工作:
- 调试自身的训练运行并跟踪训练过程中的模式。
- 管理部署并诊断测试结果。
- 优化 GPT-5.3-Codex 的运行框架并定位上下文渲染错误。
- 动态扩展 GPU 集群以应对流量激增,保持延迟稳定。
- 使用正则表达式分类器分析 alpha 测试日志,以估算生产力和用户响应频率。
交互式协作与引导
为弥合模型能力与人工监督之间的差距,GPT-5.3-Codex 在 Codex 应用中变得更加交互。用户现在可以实时引导模型——提问并讨论方案——而模型在工作时同步响应,而不必等待最终输出。此类“引导”行为可在应用设置的 General > Follow-up behavior 中开启。
网络安全与安全框架
GPT-5.3-Codex 是首个在 OpenAI Preparedness Framework 中被归类为“高能力”网络安全任务的模型,也是首个直接接受训练以识别软件漏洞的模型。
安全缓解措施
鉴于网络安全能力的双重用途,OpenAI 实施了完整的安全体系,包括:
- 安全训练与自动化监控。
- 高级能力的受信访问。
- 利用威胁情报的执行管道。
- 将 GPT-5.3-Codex 的高风险网络请求自动路由至 GPT-5.2,以防止滥用。
生态系统支持
OpenAI 正在推出 “Trusted Access for Cyber” 试点项目,面向防御研究。同时,他们正在扩大 Aardvark(安全研究代理)的私有 Beta,并为 Next.js 等重要开源项目提供免费代码库扫描。为进一步支持网络防御,OpenAI 将向网络安全资助计划提供 1000 万美元 的 API 额度,用于开源软件和关键基础设施。
技术规格与可用性
- 性能: 由于基础设施和推理栈的改进,速度比前代提升 25%。
- 硬件: 与 NVIDIA GB200 NVL72 系统共同设计、训练并部署。
- 可用性: 通过 Codex 应用、CLI、IDE 插件和网页向付费 ChatGPT 计划用户开放。API 接入计划在后续版本中提供。
性能基准
| 基准 | GPT-5.3-Codex | GPT-5.2-Codex | GPT-5.2 |
|---|---|---|---|
| SWE-Bench Pro (Public) | 56.8% | 56.4% | 55.6% |
| Terminal-Bench 2.0 | 77.3% | 64.0% | 62.2% |
| OSWorld-Verified | 64.7% | 38.2% | 37.9% |
| GDPval (wins or ties) | 70.9% | - | 70.9% (high) |
| Cybersecurity CTF Challenges | 77.6% | 67.4% | 67.7% |
| SWE-Lancer IC Diamond | 81.4% | 76.0% | 74.6% |
Sources
- OriginalIntroducing GPT-5.3-Codex