OpenAI Codex 研究預覽

OpenAI 推出 Codex 軟體工程代理

OpenAI 已推出 Codex 的研究預覽,這是一個基於雲端的軟體工程代理,能夠平行執行複雜的開發任務。Codex 允許使用者撰寫功能、修復錯誤、回答程式碼庫問題,並提出 pull request,每項任務皆在預先載入使用者倉庫的獨立雲端沙盒環境中執行。

技術架構與 codex-1 模型

Codex 由 codex-1 提供動力,這是 OpenAI o3 的一個專為軟體工程優化的版本。該模型透過強化學習在各種環境中的真實編程任務上進行訓練,以確保產生的程式碼符合人類風格、遵循 PR 偏好,並且迭代執行測試直至通過為止。

執行環境與工作流程

  • Isolated Sandboxes:每項任務在獨立的環境中獨立處理,Codex 能夠讀取與編輯檔案並執行指令,包含 type checkers、linters 與 test harnesses。
  • Verification:Codex 透過引用終端機日誌與測試輸出提供可驗證的行動證據,讓使用者能追蹤完成任務的步驟。
  • Task Duration:完成時間通常介於 1 到 30 分鐘之間,視請求的複雜度而定。
  • Integration:使用者可以檢視結果、請求修訂、開啟 GitHub pull request,或直接將變更整合到本機環境。

透過 AGENTS.md 的倉庫指引

使用者可以透過放置於倉庫內的 AGENTS.md 檔案來指導 Codex。這些檔案的功能類似於 README.md,為代理提供如何瀏覽程式碼庫、測試時執行哪些指令以及專案特定的標準作法的說明。

安全與保護框架

OpenAI 已實施多項防護措施,以確保 AI 驅動的軟體工程安全執行:

  • Secure Execution:代理在安全、隔離的雲端容器中運作。預設情況下,任務執行期間會停用網際網路存取,以限制與提供的 GitHub 倉庫及使用者自行設定的相依性之互動。
  • Abuse Prevention:模型已訓練能辨識並拒絕旨在開發惡意軟體(如惡意程式)的請求,同時持續支援合法的低階工程任務。
  • Transparency:使用者可透過終端機日誌、測試結果與引用來驗證輸出。代理被設計為會明確向使用者傳達不確定性或測試失敗的情況。

Codex CLI 與 codex-mini

除了雲端代理外,OpenAI 也提供 Codex CLI,這是一個用於本機工作流程的開源工具。全新較小的模型 codex-mini-latest(基於 o4-mini)現在成為 CLI 的預設模型。此模型針對低延遲的程式碼問答與編輯進行優化,同時保持強大的指令遵循能力。

codex-mini-latest 定價(Responses API):

  • 輸入:$1.50 per 1M tokens
  • 輸出:$6 per 1M tokens
  • 折扣:75% prompt caching discount

早期採用與使用案例

OpenAI 內部團隊與外部合作夥伴正將 Codex 用於各種工程工作流程:

  • OpenAI Engineers:使用此工具進行重構、重新命名、撰寫測試以及搭建新功能,以減少上下文切換。
  • Cisco:評估 Codex 在其產品組合中的實際使用案例。
  • Temporal:使用代理加速功能開發、除錯問題,並重構大型程式碼庫。
  • Superhuman:運用 Codex 提升測試覆蓋率並修復整合失敗,使產品經理能貢獻輕量級程式碼變更。
  • Kodiak:利用 Codex 撰寫除錯工具並了解堆疊中不熟悉的部分。

可用性與路線圖

Codex 目前正向 ChatGPT Pro、Enterprise 與 Business 使用者推出。預計很快會支援 ChatGPT Plus 與 Edu 使用者。

目前限制:

  • 缺乏前端工作的圖像輸入。
  • 無法在任務進行中對代理進行校正。
  • 由於代理是遠端的,較互動式編輯有更高的延遲。

未來計畫: OpenAI 計畫推出更多互動式工作流程,讓開發者能在任務進行中提供指導並接收主動更新。未來的整合將針對 Codex CLI、ChatGPT Desktop、問題追蹤系統與 CI 系統進行規劃。

Sources