GPT-5.3-Codex 版本說明 / 新功能

OpenAI 推出了 GPT-5.3-Codex,一款高能力的代理式程式碼模型,旨在處理包含研究、工具使用與複雜執行的長時間任務。該模型結合了 GPT-5.2-Codex 的前沿程式碼效能與 GPT-5.2 的推理與專業知識,同時運行速度比前代提升 25%。

前沿代理能力

GPT-5.3-Codex 在程式碼與電腦使用任務上樹立了新的業界基準,超越了單純的程式碼生成,實現自主執行。

軟體工程與終端技能

GPT-5.3-Codex 在 SWE-Bench Pro(多語言真實世界軟體工程評估)上達到最先進的表現,並在 Terminal-Bench 2.0 上顯著超過先前的成績。值得注意的是,模型使用的 token 數量比先前模型更少,提升了使用者的效率。

網頁開發與迭代設計

該模型展示了從頭構建複雜且功能完整的遊戲與應用程式的高階能力。在內部測試中,GPT-5.3-Codex 以「修正錯誤」或「改進遊戲」等通用後續提示,於數百萬 token 中自主迭代賽車遊戲與潛水遊戲。

此外,模型在日常網站建置的意圖理解上有所提升。例如,當要求建立「Quiet KPI」的登陸頁面時,GPT-5.3-Codex 自動實作了可直接上線的功能——如年度方案的月付折扣價格以及可切換的見證輪播,這些在 GPT-5.2-Codex 中並未出現。

一般專業知識工作

GPT-5.3-Codex 支援完整的軟體生命週期,包括除錯、部署、監控、撰寫 PRD 與使用者研究。其能力亦延伸至一般知識工作,在 GDPval 基準(衡量 44 種職業的表現,包含製作試算表與簡報)上與 GPT-5.2 表現相當。

在電腦使用能力方面,GPT-5.3-Codex 在 OSWorld-Verified 基準上顯示出顯著的性能躍升,該基準要求代理使用視覺在視覺化桌面環境中完成生產力任務。

自我改進的開發循環

GPT-5.3-Codex 是第一個在自身創建過程中發揮關鍵作用的 OpenAI 模型。Codex 團隊利用早期版本的模型來:

  • 除錯自身的訓練執行並追蹤訓練過程中的模式。
  • 管理部署並診斷測試結果。
  • 優化 GPT-5.3-Codex 的 harness 並找出上下文渲染錯誤。
  • 動態擴展 GPU 叢集以因應流量激增,維持延遲穩定。
  • 使用正則表達式分類器分析 alpha 測試日誌,以估算生產力與使用者回應頻率。

互動式協作與導向

為縮小模型能力與人工監督之間的差距,GPT-5.3-Codex 在 Codex 應用中變得更具互動性。使用者現在可以即時導向模型——提出問題、討論方法——同時模型仍在執行,而不必等到最終輸出。此「導向」行為可在應用設定的「General > Follow-up behavior」中啟用。

網路安全與安全框架

GPT-5.3-Codex 是第一個在 OpenAI 準備框架下被歸類為「高能力」的網路安全任務模型,也是第一個直接訓練以識別軟體漏洞的模型。

安全緩解措施

鑑於網路安全能力的雙重用途性,OpenAI 實施了完整的安全堆疊,包括:

  • 安全訓練與自動監控。
  • 進階能力的受信任存取。
  • 利用威脅情報的執行管線。
  • 自動將 GPT-5.3-Codex 的高風險網路請求導向 GPT-5.2,以防止濫用。

生態系統支援

OpenAI 正推出「Trusted Access for Cyber」計畫,作為防禦研究的試點。亦在擴大 Aardvark(安全研究代理)的私有測試版,並為 Next.js 等主要開源專案提供免費程式碼掃描。為進一步支援網路防禦,OpenAI 將向開源軟體與關鍵基礎設施的網路安全補助計畫提供 1,000 萬美元的 API 點數。

技術規格與可用性

  • 效能: 由於基礎設施與推論堆疊的改進,比前一版本快 25%。
  • 硬體: 共同設計、訓練並在 NVIDIA GB200 NVL72 系統上提供服務。
  • 可用性: 透過 Codex 應用、CLI、IDE 擴充與網頁,向付費 ChatGPT 計畫提供。API 存取計畫於未來版本推出。

效能基準

基準 GPT-5.3-Codex GPT-5.2-Codex GPT-5.2
SWE-Bench Pro(公開) 56.8% 56.4% 55.6%
Terminal-Bench 2.0 77.3% 64.0% 62.2%
OSWorld-Verified 64.7% 38.2% 37.9%
GDPval(勝或平) 70.9% - 70.9% (high)
網路安全 CTF 挑戰 77.6% 67.4% 67.7%
SWE-Lancer IC Diamond 81.4% 76.0% 74.6%

Sources