OpenAI GPT-5-Codex 發布與 Codex 平台更新

OpenAI 已推出 GPT-5-Codex,一個針對代理式軟體工程優化的 GPT-5 專屬版本。此更新將 Codex 從單純的程式碼助理轉變為能獨立執行長期任務、進行深入程式碼審查,並在本機與雲端環境之間整合的團隊成員。

GPT-5-Codex:代理式軟體工程

GPT-5-Codex 專門針對真實世界的軟體工程工作流程進行訓練,涵蓋從頭構建完整專案、除錯、大規模重構以及新增功能與測試等。與通用模型不同,它設計得更易於指導,且更嚴格遵守 AGENTS.md 的指示。

動態推理與效能

GPT-5-Codex 會根據任務複雜度動態調整推理時間。這讓模型在互動聊天時保持回應速度,同時在複雜任務上投入更多時間。

  • 長期自主性: 在測試中,模型曾獨立工作超過 7 小時,處理複雜任務、迭代實作並修復測試失敗。
  • 代幣效率: 在使用者回合的最低 10%(依模型產生的代幣數排序)中,GPT-5-Codex 使用的代幣比 GPT-5 少 93.7%。在最複雜的前 10% 回合中,它花費兩倍的時間於推理、編輯與測試。
  • 基準測試: OpenAI 現已報告全部 500 個 SWE-bench Verified 任務的結果,已解決先前僅能報告 477 個任務的基礎設施限制。
  • 重構: 模型在大型程式庫的重構任務上進行評估,涵蓋 Python、Go 與 OCaml,包含一次涉及 232 個檔案、3,541 行程式碼的 Gitea Pull Request。

程式碼審查能力

GPT-5-Codex 受訓於透過瀏覽程式碼庫、推理相依性、執行程式碼與測試來驗證正確性,從而辨識關鍵缺陷。它能將 Pull Request(PR)的意圖與實際 diff 進行比對,超越靜態分析工具的能力。在 OpenAI,模型現在審查大多數內部 PR,每天捕捉數百個問題。

前端與視覺整合

模型在人類偏好評估上於行動網站與桌面應用程式皆有顯著提升。當在雲端運行時,GPT-5-Codex 能將影像或螢幕截圖作為輸入,視覺檢查自身進度,並將最終結果的螢幕截圖附加至任務或 GitHub PR。

Codex 平台更新

OpenAI 已將 Codex 統一為單一產品體驗,透過 ChatGPT 帳號連結,實現本機與雲端環境之間的無縫切換。

Codex CLI 與 IDE 擴充套件

  • Codex CLI: 開源 CLI 已重新構建以支援代理式工作流程。現在支援影像附件(螢幕截圖、線框圖)、進度追蹤待辦清單、網路搜尋,以及用於外部系統連接的 Model Context Protocol(MCP)。終端 UI 更新包括工具呼叫與 diff 的更佳格式化,並提供三種簡化的批准模式(唯讀、自動、完整存取)。
  • IDE 擴充套件: 現已支援 VS Code、Cursor 以及其他 VS Code 分支。此擴充套件允許開發者預覽本機變更,並在雲端與本機環境之間移動工作而不失去上下文。

Codex Cloud

雲端基礎設施效能透過快取容器得到提升,新任務與後續任務的中位完成時間縮短了 90%。雲端代理現在能自動掃描設定腳本並執行,並可設定是否允許網路存取以透過 pip install 等指令取得相依套件。

安全與風險防護

為防止資料外洩與濫用,Codex 於沙盒環境中執行,預設關閉網路存取。安全功能包括:

  • 基於權限的操作: 代理在執行危險操作前會請求許可。
  • 可自訂存取權限: 開發者可將雲端網路存取限制於受信任的網域,或授予 CLI/IDE 擴充套件網路搜尋與 MCP 伺服器的存取權限。
  • 領域防護: GPT-5-Codex 在生物與化學領域被分類為「高能力」,已實施特定防護措施以降低相關風險。

定價與可用性

GPT-5-Codex 已向 ChatGPT Plus、Pro、Business、Edu 與 Enterprise 使用者開放。自 2025 年 9 月 23 日起,開發者亦可透過 Responses API 使用 Codex(API 金鑰),價格與 GPT-5 完全相同。

  • Plus、Edu 與 Business: 每週支援少量聚焦的編程會話。
  • Pro: 支援整個工作週的多專案開發。
  • Business/Enterprise: 提供基於點數的擴充方案以滿足額外使用需求。

Sources