GPT-5.3-Codex 发布说明 / 新功能

OpenAI 推出了 GPT-5.3-Codex,这是一款高能力的代理式编码模型,旨在处理涉及研究、工具使用和复杂执行的长期任务。该模型将 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业知识相结合,运行速度比前代提升 25%。

前沿代理能力

GPT-5.3-Codex 在编码和计算机使用任务上树立了新的行业基准,超越了单纯的代码生成,实现了自主执行。

软件工程与终端技能

GPT-5.3-Codex 在 SWE-Bench Pro(真实软件工程的多语言评估)上达到了业界领先水平,并在 Terminal-Bench 2.0 上显著超越了之前的表现。值得注意的是,模型使用的 token 数量少于之前的模型,为用户提升了效率。

Web 开发与迭代设计

该模型展示了从零构建复杂、可运行的游戏和应用的高级能力。在内部测试中,GPT-5.3-Codex 使用数百万 token,凭借诸如“修复 bug”或“改进游戏”等通用后续提示,独立迭代了赛车游戏和潜水游戏。

此外,模型在日常网站创建的意图理解上有所提升。例如,当要求为 “Quiet KPI” 构建登录页时,GPT-5.3-Codex 自动实现了生产就绪的功能——如年度计划的折扣月付价以及可切换的推荐语轮播,这些在 GPT-5.2-Codex 中均未出现。

通用专业知识工作

GPT-5.3-Codex 支持完整的软件生命周期,包括调试、部署、监控、撰写 PRD 与用户调研。其能力还延伸至通用知识工作,在 GDPval 基准上与 GPT-5.2 持平,该基准衡量 44 种职业的表现,包括制作电子表格和演示文稿。

在计算机使用能力方面,GPT-5.3-Codex 在 OSWorld-Verified 基准上实现了显著跃升,该基准要求代理在可视化桌面环境中使用视觉完成生产力任务。

自我改进开发周期

GPT-5.3-Codex 是首个在自身创建过程中发挥关键作用的 OpenAI 模型。Codex 团队利用模型的早期版本完成了以下工作:

  • 调试自身的训练运行并跟踪训练过程中的模式。
  • 管理部署并诊断测试结果。
  • 优化 GPT-5.3-Codex 的运行框架并定位上下文渲染错误。
  • 动态扩展 GPU 集群以应对流量激增,保持延迟稳定。
  • 使用正则表达式分类器分析 alpha 测试日志,以估算生产力和用户响应频率。

交互式协作与引导

为弥合模型能力与人工监督之间的差距,GPT-5.3-Codex 在 Codex 应用中变得更加交互。用户现在可以实时引导模型——提问并讨论方案——而模型在工作时同步响应,而不必等待最终输出。此类“引导”行为可在应用设置的 General > Follow-up behavior 中开启。

网络安全与安全框架

GPT-5.3-Codex 是首个在 OpenAI Preparedness Framework 中被归类为“高能力”网络安全任务的模型,也是首个直接接受训练以识别软件漏洞的模型。

安全缓解措施

鉴于网络安全能力的双重用途,OpenAI 实施了完整的安全体系,包括:

  • 安全训练与自动化监控。
  • 高级能力的受信访问。
  • 利用威胁情报的执行管道。
  • 将 GPT-5.3-Codex 的高风险网络请求自动路由至 GPT-5.2,以防止滥用。

生态系统支持

OpenAI 正在推出 “Trusted Access for Cyber” 试点项目,面向防御研究。同时,他们正在扩大 Aardvark(安全研究代理)的私有 Beta,并为 Next.js 等重要开源项目提供免费代码库扫描。为进一步支持网络防御,OpenAI 将向网络安全资助计划提供 1000 万美元 的 API 额度,用于开源软件和关键基础设施。

技术规格与可用性

  • 性能: 由于基础设施和推理栈的改进,速度比前代提升 25%。
  • 硬件: 与 NVIDIA GB200 NVL72 系统共同设计、训练并部署。
  • 可用性: 通过 Codex 应用、CLI、IDE 插件和网页向付费 ChatGPT 计划用户开放。API 接入计划在后续版本中提供。

性能基准

基准 GPT-5.3-Codex GPT-5.2-Codex GPT-5.2
SWE-Bench Pro (Public) 56.8% 56.4% 55.6%
Terminal-Bench 2.0 77.3% 64.0% 62.2%
OSWorld-Verified 64.7% 38.2% 37.9%
GDPval (wins or ties) 70.9% - 70.9% (high)
Cybersecurity CTF Challenges 77.6% 67.4% 67.7%
SWE-Lancer IC Diamond 81.4% 76.0% 74.6%

Sources