GPT-5-Codex 发布与安全附录

OpenAI 已推出 GPT-5-Codex,这是一款针对代理式编码进行优化的 GPT-5 专用版本。该模型旨在生成符合人类编码风格、严格遵循指令,并通过迭代测试自身输出以确保通过结果的代码。

代理式编码能力

GPT-5-Codex 为 Codex 中的代理工作流进行了优化。为实现此目标,模型使用强化学习(RL)在各种环境中的真实编码任务上进行训练。这种训练方法使模型能够:

  • 镜像人类风格: 生成符合人类编码风格和拉取请求(PR)偏好的代码。
  • 遵循指令: 高精度地遵循复杂指令。
  • 迭代测试: 迭代运行测试,直至获得成功结果。

可用性与集成

GPT-5-Codex 在多个接口上可用,以支持本地和云端的开发工作流:

  • 本地访问: 通过 Codex CLI 和 IDE 扩展提供。
  • 云访问: 通过 Codex 网页界面、GitHub 和 ChatGPT 移动应用提供。

安全与缓解措施

OpenAI 为 GPT-5-Codex 实施了多层安全框架,以降低与代理代码生成相关的风险。这些措施分为模型层面和产品层面两类缓解措施:

模型层面缓解措施

这些缓解措施直接嵌入模型的训练和行为中:

  • 专门的安全训练: 模型已接受特定训练,以防止执行有害任务。
  • 提示注入防御: 包含训练以降低提示注入风险。

产品层面缓解措施

这些缓解措施在应用和环境层面实现:

  • 代理沙箱化: 模型在沙箱中运行,以将代理行为与宿主系统隔离。
  • 可配置网络访问: 可配置代理的网络访问,以限制潜在的外部风险。

Sources