OpenAI GPT-5.1 版本說明

OpenAI 已發布 GPT-5.1,一個專為代理和編碼工作流程平衡高層次智慧與執行速度而設計的模型。此更新引入了自適應推理,根據任務複雜度調整思考時間,提供低延遲回應的專用模式,以及用於直接程式碼與系統互動的新開發者工具。

自適應推理與效率

GPT-5.1 使用經過改進的訓練方法,使其能夠根據請求的複雜度動態調整花費在「思考」上的時間和 token 數量。這使得簡單任務的回應更快、token 成本更低,同時不影響複雜問題的可靠性。

效能提升

  • 延遲減少: 對於簡單查詢,例如請求一個 npm 指令,GPT-5.1 能將回應時間從 10 秒減少到 2 秒。
  • 第三方驗證: Balyasny Asset Management 報告表示 GPT-5.1 的執行速度比 GPT-5 快 2-3 倍,且在工具密集型推理任務中使用的 token 數量約為領先競爭對手的一半。Pace 報告指出,他們的代理執行速度提升了 50%,同時準確度超越了 GPT-5。

'無推理' 模式

開發者可以將 reasoning_effort 參數設定為 none 來停用推理。此模式針對對延遲敏感的使用場景進行了優化,相較於 GPT-5 的『最小』推理設定,提供了以下幾項優勢:

  • 能力提升: 在平行工具呼叫、編碼任務、指令遵循以及搜尋工具的使用上表現更佳。
  • 網頁搜尋: 支援在 API 平台內進行網頁搜尋。
  • 實際影響: Sierra 觀察到,相較於 GPT-5 的最小推理,低延遲工具呼叫效能提升了 20%。

延伸 Prompt 快取

為進一步降低延遲與成本,GPT-5.1 支援延伸的 Prompt 快取,保留時間可達 24 小時(透過 prompt_cache_retention='24h' 參數)。這相較於先前的限制有顯著提升,有助於實現更順暢的多輪對話與長時間編碼工作階段。快取的輸入 token 成本仍為未快取 token 的 10%。

編碼能力增強

GPT-5.1 在可引導性、程式碼品質以及工具呼叫期間使用者面臨更新訊息的清晰度方面,優於 GPT-5。它專門針對簡單編輯進行最佳化,以減少「過度思考」,同時在複雜任務上保持高效能。

基準測試與業界回饋

  • SWE-bench 已驗證: GPT-5.1 獲得 76.3% 的分數,超過 GPT-5 的 72.8%。
  • 開發者工具: 包括 Cursor、Cognition、Augment Code、Factory 和 Warp 在內的公司合作塑造了該模型的編碼個性。Augment Code 指出在多檔案專案中變更更準確且迭代更快速,而 Cline 報告在他們的 diff 編輯基準上提升了 7%。

新增開發者工具

兩項新工具在 Responses API 中被引入,以實現更可靠的代理行為:

apply_patch 工具

此工具允許模型使用結構化的 diff 建立、更新和刪除檔案。透過發出補丁操作而非僅僅建議編輯,模型得以啟用更可靠、反覆的多步驟編輯工作流程,無需進行 JSON 轉義。

Shell 工具

Shell 工具使模型能夠提出在本機上執行的命令列介面 (CLI) 指令。這會建立一個規劃-執行迴圈,模型可在此檢查系統、執行實用程式並收集資料以完成任務。

模型可用性與變體

GPT-5.1 與 gpt-5.1-chat-latest 在所有付費 API 層級上對開發者開放,其定價與速率限制與 GPT-5 相同。此外,OpenAI 已發布 gpt-5.1-codexgpt-5.1-codex-mini,這兩個模型專為在類似 Codex 的環境中進行長時間運行的代理編碼任務而優化。

技術評估摘要

評估 GPT-5.1 (high) GPT-5 (high)
SWE-bench 已驗證 76.3% 72.8%
GPQA Diamond (無工具) 88.1% 85.7%
AIME 2025 (無工具) 94.0% 94.6%
FrontierMath (含 Python) 26.7% 26.3%
MMMU 85.4% 84.2%
Tau 2-bench 航空 67.0% 62.6%
Tau 2-bench 電信 95.6% 96.7%
Tau 2-bench 零售 77.9% 81.1%
BrowseComp 長文脈絡 128k 90.0% 90.0%

{"summary": "OpenAI 已發布 GPT-5.1,透過自適應推理、全新的 '無推理' 模式以及專門的編碼工具,優化智慧與速度的平衡。", "title": "OpenAI GPT-5.1 版本說明"}

Sources