OpenAI Codex 研究预览

OpenAI 推出 Codex 软件工程代理

OpenAI 已推出 Codex 的研究预览版,这是一款基于云的软件工程代理,能够并行执行复杂的开发任务。Codex 允许用户编写功能、修复错误、回答代码库问题并提出拉取请求,每个任务都在预装用户仓库的独立云沙箱环境中执行。

技术架构与 codex-1 模型

Codex 由 codex-1 提供动力,这是 OpenAI o3 的一个专为软件工程优化的版本。该模型通过强化学习在各种真实环境中的编码任务上进行训练,以确保生成的代码符合人类风格、遵循 PR 偏好,并迭代运行测试直至获得通过的结果。

执行环境与工作流

  • Isolated Sandboxes:每个任务在独立的环境中独立处理,Codex 可以读取和编辑文件并执行命令,包括类型检查器、代码检查工具和测试框架。
  • Verification:Codex 通过引用终端日志和测试输出提供可验证的行动证据,允许用户追踪完成任务的步骤。
  • Task Duration:完成时间通常在 1 到 30 分钟之间,具体取决于请求的复杂度。
  • Integration:用户可以审查结果、请求修订、打开 GitHub 拉取请求,或将更改直接集成到本地环境中。

通过 AGENTS.md 指导仓库

用户可以在仓库中放置 AGENTS.md 文件来指导 Codex。这些文件的功能类似于 README.md,为代理提供如何浏览代码库、运行哪些测试命令以及项目特定标准实践的指示。

安全与保障框架

OpenAI 已实施多项保障措施,以确保 AI 驱动的软件工程安全执行:

  • Secure Execution:代理在安全、隔离的云容器中运行。默认情况下,任务执行期间禁用互联网访问,以将交互限制在提供的 GitHub 仓库和用户配置的依赖项上。
  • Abuse Prevention:模型经过训练,可识别并拒绝旨在开发恶意软件(如恶意软件)的请求,同时继续支持合法的底层工程任务。
  • Transparency:用户可以通过终端日志、测试结果和引用来验证输出。代理被设计为明确向用户传达不确定性或测试失败。

Codex CLI 与 codex-mini

除了云代理外,OpenAI 还提供 Codex CLI,这是一款用于本地工作流的开源工具。全新的小模型 codex-mini-latest(基于 o4-mini)现已成为 CLI 的默认模型。该模型针对低延迟的代码问答和编辑进行优化,同时保持强大的指令遵循能力。

codex-mini-latest 定价(Responses API):

  • Input:每 1M 令牌 $1.50
  • Output:每 1M 令牌 $6
  • Discount:75% 提示缓存折扣

早期采用与使用案例

OpenAI 内部团队和外部合作伙伴正在将 Codex 用于各种工程工作流:

  • OpenAI Engineers:使用该工具进行重构、重命名、编写测试以及搭建新功能的脚手架,以减少上下文切换。
  • Cisco:评估 Codex 在其产品组合中的真实使用案例。
  • Temporal:使用代理加速功能开发、调试问题并重构大型代码库。
  • Superhuman:应用 Codex 提高测试覆盖率并修复集成失败,使产品经理能够贡献轻量级代码更改。
  • Kodiak:利用 Codex 编写调试工具并理解堆栈中不熟悉的部分。

可用性与路线图

Codex 正在向 ChatGPT Pro、Enterprise 和 Business 用户逐步推出。预计很快将支持 ChatGPT Plus 和 Edu 用户。

当前限制:

  • 缺乏前端工作的图像输入。
  • 无法在任务进行中对代理进行纠正。
  • 由于代理的远程特性,延迟高于交互式编辑。

未来计划: OpenAI 打算引入更多交互式工作流,允许开发者在任务进行中提供指导并接收主动更新。未来计划将 Codex CLI、ChatGPT Desktop、问题跟踪器和 CI 系统进行集成。

Sources