GPT-5 開發者發佈說明

OpenAI 已透過其 API 平台發布 GPT-5,推出一系列針對程式編寫與複雜代理任務進行最佳化的新模型。GPT-5 在軟體工程與工具呼叫方面樹立了全新的最先進(SOTA)基準,同時引入了以開發者為中心的推理努力與回應詳盡度控制。

最先進的程式編寫與前端能力

GPT-5 被設計為程式協作者,能夠修復錯誤、編輯程式碼,並在複雜的程式碼庫中導航。它在關鍵軟體工程基準測試中超越了包括 o3 在內的先前模型。

  • SWE-bench Verified: GPT-5 獲得 74.9% 的分數,超過 o3 的 69.1%。在高推理努力下,它以 22% 更少的輸出 token 以及 45% 更少的工具呼叫達成此成績。
  • Aider Polyglot: 該模型取得創紀錄的 88% 分數,錯誤率較 o3 減少了三分之一。
  • Frontend Development: 在內部測試中,GPT-5 在前端網頁開發上因美感與程式碼品質提升,被偏好於 o3 的比例達 70%。

包括 Cursor、Windsurf 與 Vercel 在內的早期採用者表示,GPT-5 是他們使用過的最智慧的程式模型,並指出其易於操控以及在美觀前端任務中的高效能。

進階代理智慧與工具使用

GPT-5 在執行長時間運行的代理任務以及串接複雜工具呼叫而不失去上下文方面展現了顯著的提升。

  • Tool Calling Performance: GPT-5 在 τ 2-bench 電信基準上取得 96.7% 的分數,較先前的前沿模型有大幅提升,之前沒有任何模型超過 49%。
  • Instruction Following: 該模型在 Scale MultiChallenge(由 o3-mini 評分)取得 69.6% 的分數,並在 COLLIE 上取得 99%。
  • Long-Context Retrieval: GPT-5 在 OpenAI-MRCR 基準上超越 o3 與 GPT-4.1,且隨著輸入長度增加,效能提升更為明顯。在 BrowseComp 長上下文基準(128K–256K token)中,它的正確回答率為 89%。
  • Context Window: 所有 GPT-5 模型支援最高 272,000 個輸入 token 以及 128,000 個推理與輸出 token,總計 400,000 token 的上下文長度。

新的 API 功能供開發者控制

OpenAI 引入了多項參數與工具類型,讓開發者能更細緻地控制模型行為:

  • reasoning_effort Parameter: 開發者現在可以從 minimallowmedium(預設)與 high 中選擇。minimal 設定會將推理時間最小化,以更快返回答案。
  • verbosity Parameter: 新增的參數可設定為 lowmedium(預設)與 high,用以控制回應的長度。明確的提示指令會覆寫此設定。
  • Custom Tools: GPT-5 現在支援以純文字而非 JSON 呼叫工具。此方式減少了長輸出中轉義控制字元所導致的錯誤。開發者可使用正則表達式或上下文無關文法來限制這些工具。
  • Preamble Messages: 在指示下,GPT-5 可以在工具呼叫前後輸出可見訊息,以向最終使用者傳達其計畫與進度。

事實性與安全性

與先前模型相比,GPT-5 的幻覺現象顯著減少。在 LongFact 與 FactScore 基準上,GPT-5 的事實錯誤約比 o3 少 80%。該模型亦針對健康相關問題進行了特別調校,以提升準確度,並增強對自身限制的自我認知。

模型可用性與定價

GPT-5 提供三種規格,讓開發者在效能、成本與延遲之間取得平衡。它亦可透過 Responses API、Chat Completions API 以及作為 Codex CLI 的預設模型使用。

模型 輸入價格(每 1M token) 輸出價格(每 1M token)
gpt-5 $1.25 $10.00
gpt-5-mini $0.25 $2.00
gpt-5-nano $0.05 $0.40

此外,ChatGPT 使用的非推理版本可作為 gpt-5-chat-latest($1.25 輸入 / $10.00 輸出)取得。GPT-5 也正部署於 Microsoft 各平台,包括 Azure AI Foundry、GitHub Copilot 與 Microsoft 365 Copilot。

Sources