OpenAI GPT-5-Codex 发布及 Codex 平台更新

OpenAI 推出了 GPT-5-Codex,这是 GPT-5 的专门版本,针对代理式软件工程进行了优化。此更新将 Codex 从编码助手转变为能够独立执行长期任务、进行深入代码审查并在本地和云环境中进行集成的团队成员。

GPT-5-Codex:代理式软件工程

GPT-5-Codex 专门针对真实的软件工程工作流进行训练,包括从零构建完整项目、调试、执行大规模重构以及添加功能和测试。与通用模型不同,它设计得更易于引导,并更严格遵循 AGENTS.md 指令。

动态推理与性能

GPT-5-Codex 会根据任务复杂度动态调整推理时间。这使得模型在交互式聊天会话中保持响应,同时在复杂任务上投入更多时间。

  • 长期自主性: 在测试中,模型在复杂任务上独立工作超过 7 小时,迭代实现并修复测试失败。
  • 令牌效率: 对于用户回合中令牌使用量最低的 10%(按模型生成的令牌数排序),GPT-5-Codex 使用的令牌比 GPT-5 少 93.7%。对于最复杂的 10% 回合,它在推理、编辑和测试上花费的时间是原来的两倍。
  • 基准测试: OpenAI 现在报告所有 500 项 SWE-bench Verified 任务的结果,已解决之前基础设施限制导致只能报告 477 项任务的问题。
  • 重构: 该模型在来自大型仓库的重构任务上进行评估,涉及 Python、Go 和 OCaml 等语言,包括一次涉及 232 个文件、3,541 行代码的 Gitea 拉取请求。

代码审查能力

GPT-5-Codex 通过遍历代码库、推理依赖关系并执行代码和测试来验证正确性,从而被训练用于识别关键缺陷。它将拉取请求(PR)的声明意图与实际差异匹配,超越了静态分析工具的能力。在 OpenAI,模型现在审查大多数内部 PR,每天捕获数百个问题。

前端与视觉集成

该模型在人类偏好评估中对移动网站和桌面应用表现出显著提升。在云端运行时,GPT-5-Codex 能够将图像或截图作为输入,视觉检查自身进度,并将最终结果的截图附加到任务或 GitHub PR 中。

Codex 平台更新

OpenAI 已将 Codex 统一为通过 ChatGPT 账户连接的单一产品体验,实现本地与云环境之间的无缝切换。

Codex CLI 与 IDE 扩展

  • Codex CLI: 开源 CLI 已为代理式工作流重新构建。它现在支持图像附件(截图、线框图)、进度跟踪待办列表、网络搜索以及用于外部系统连接的模型上下文协议(Model Context Protocol,MCP)。终端 UI 更新包括对工具调用和差异的更好格式化,以及三种简化的批准模式(只读、自动和完全访问)。
  • IDE 扩展: 现已支持 VS Code、Cursor 以及其他 VS Code 分支。该扩展允许开发者预览本地更改,并在云端与本地环境之间移动工作而不丢失上下文。

Codex 云

通过缓存容器,云基础设施性能得到提升,新任务和后续任务的中位完成时间降低了 90%。云代理现在可以通过扫描设置脚本并执行它们自动搭建环境,并可配置互联网访问,以通过类似 pip install 的命令获取依赖。

安全与保障

为防止数据外泄和滥用,Codex 在默认禁用网络访问的沙箱环境中运行。安全特性包括:

  • 基于权限的操作: 代理在执行危险操作前可以请求权限。
  • 可定制访问: 开发者可以将云网络访问限制在受信任域,或授予 CLI/IDE 扩展对网络搜索和 MCP 服务器的访问权限。
  • 领域防护: GPT-5-Codex 在生物和化学领域被归类为“高能力”,已实施特定防护措施以降低相关风险。

定价与可用性

GPT-5-Codex 对 ChatGPT Plus、Pro、Business、Edu 和 Enterprise 用户开放。自 2025 年 9 月 23 日起,开发者也可通过 Responses API 使用 API 密钥使用 Codex,定价与 GPT-5 相同。

  • Plus、Edu 和 Business: 每周支持少量专注的编码会话。
  • Pro: 支持跨多个项目的完整工作周。
  • Business/Enterprise: 提供基于信用的扩展,以满足额外使用需求。

Sources