OpenAI GPT-5.4 發布:具備 1M 令牌上下文的統一推理、程式編寫與電腦使用模型

OpenAI GPT-5.4 發布:具備 1M 令牌上下文的統一推理、程式編寫與電腦使用模型

TL;DR

OpenAI 發布了 GPT‑5.4,這是其在專業工作領域最強大且最高效的前沿模型,現在可在 ChatGPT(作為 Thinking)、API 與 Codex 中使用,並提供效能更高的 Pro 變體。該模型加入了原生電腦使用功能、最高 1 M 令牌上下文、更佳的工具搜尋,以及更強大的推理、程式編寫與知識工作能力,於各種基準測試中提供更高的準確度、更低的令牌使用量與更快的速度。


發布概覽

OpenAI 在 2026 年 3 月 5 日宣布推出 GPT‑5.4。該模型在三條產品線上部署:

  • ChatGPT – 作為 GPT‑5.4 Thinking(標準)與 GPT‑5.4 Pro(最高效能)。
  • API – 可透過 gpt-5.4gpt-5.4-pro 端點存取。
  • Codex – 整合了新的程式編寫導向功能。

GPT‑5.4 結合了近期在推理、程式編寫與代理工作流程方面的進展,繼承了 GPT‑5.3‑Codex 的程式編寫優勢,同時在試算表、簡報、文件與工具豐富的環境中提升效能。


主要技術改進

統一推理與規劃

  • 前置規劃 – 在 ChatGPT 中,模型現在會在產生回應前先列出其思考流程,讓使用者能在回應過程中調整計畫。
  • 更長上下文 – 支援最高 1 M 令牌,使代理能在極長的任務中保持前後一致性。
  • 降低令牌消耗 – 相較於 GPT‑5.2,在相同推理下使用顯著更少的令牌,降低成本與延遲。

原生電腦使用

  • 首個具備內建電腦使用功能的通用模型,允許代理透過如 Playwright 等函式庫控制應用程式,並可從螢幕截圖發出滑鼠/鍵盤操作。
  • 工具搜尋 – 不再預先載入所有工具定義,模型可按需取得工具定義,於大型工具密集工作流程中將令牌使用量減少 ≈47 %
  • 工具呼叫準確度 – 在 Toolathon 與 τ2‑bench 等基準測試中提升多步驟工具使用的表現,以更少的互動回合達成更高的準確度。

視覺與感知

  • 引入 original 影像細節等級(最高 10.24 M 像素)並將 high 等級擴展至 2.56 M 像素,提升定位、點擊精度與密集影像理解。
  • 在 MMMU‑Pro(未使用工具)上達到 81.2 %,使用工具時為 82.1 %,超過 GPT‑5.2。

程式編寫增強

  • 結合 GPT‑5.3‑Codex 的程式編寫優勢與全新的推理與工具功能。
  • Codex 中的 /fast mode 可提供最高 1.5× 更快的令牌速度,且不犧牲智慧。
  • 推出實驗性的 Playwright (Interactive) 技能,用於網頁/Electron 應用的視覺除錯與自動化測試。

基準表現

基準測試 GPT‑5.4 GPT‑5.3‑Codex GPT‑5.2
GDPval(知識工作) 83.0 % 70.9 %
SWE‑Bench Pro(程式編寫) 57.7 % 55.6 %
OSWorld‑Verified(桌面電腦使用) 75.0 % 74.0 % 47.3 %
WebArena‑Verified(瀏覽器使用) 67.3 % 65.4 %
BrowseComp(網路搜尋) 82.7 % (standard) / 89.3 % (Pro) 77.3 % 65.8 %
MMMU‑Pro(視覺) 81.2 % (no tools) / 82.1 % (with tools) 79.5 %
Toolathlon(工具使用) 54.6 % 45.7 %
投資銀行試算表任務(內部) 87.3 % 68.4 %
簡報品質(人工評分) 68.0 % preferred over GPT‑5.2

所有評估皆在推理努力設定為 xhigh 的情況下執行,除非另有說明。


真實世界能力

專業知識工作

  • 在 44 種職業的 GDPval 比較中,達到或超過業界專業人士 83 % 的表現。
  • 降低事實錯誤:單一主張出錯的機率降低 33 %,完整回應出錯的機率降低 18 %(相較於 GPT‑5.2)。
  • 產生更高品質的試算表、簡報與文件,人工評分者更偏好 GPT‑5.4 的輸出,因其美觀與功能多樣性。

電腦使用代理

  • 在桌面導航上達到業界領先的成功率(75 % 對比 GPT‑5.2 的 47 %),以及網路互動基準測試(在 Online‑Mind2Web 上最高 92.8 %)。
  • 透過工具搜尋與平行工具產出,支援協調的多工具工作流程,降低延遲。
  • 在財產稅門戶任務中展示了 95 % 的首次成功率,完成會話的速度提升 ~3×,且使用的令牌減少 ~70 %

程式編寫與開發

  • 在 SWE‑Bench Pro 上超越 GPT‑5.3‑Codex,且延遲更低。
  • Playwright (Interactive) 技能在程式碼生成過程中提供視覺除錯與自動化測試,示例為僅用單一提示構建的完整主題樂園模擬。

安全性與治理

  • 根據 OpenAI 的備援框架,將其歸類為 高網路能力,並擴大監控、可信存取控制,以及對零資料保留(ZDR)環境中高風險請求的非同步阻斷。
  • 推出開源的 CoT 可控性 評估,顯示 GPT‑5.4 隱藏思考鏈的能力低,強化了 CoT 監控的有效性。
  • 持續的優化可能導致 ZDR 客戶偶爾出現誤判的拒絕,因為分類器在改進中。

可用性與定價

  • ChatGPT – GPT‑5.4 Thinking 已對 Plus、Team 與 Pro 用戶上線;GPT‑5.4 Pro 可供 Pro 與 Enterprise 計畫使用。舊版 GPT‑5.2 Thinking 仍保留至 2026 年 6 月 5 日。
  • APIgpt-5.4(標準)與 gpt-5.4-pro(最高效能)已上線。每 M 令牌的定價為:輸入 $2.50、快取輸入 $0.25、輸出 $15(標準);Pro 變體為輸入 $30、輸出 $180。
  • 上下文視窗 – 預設 272 K 令牌;實驗性的 1 M 令牌視窗可透過 model_context_windowmodel_auto_compact_token_limit 啟用,超過 272 K 的使用量將以 2 倍的正常費率計費。

對開發者與企業的影響

  • 更高生產力 – 模型的規劃、更長上下文與高效工具使用,減少完成複雜任務所需的互動回合數。
  • 成本效益 – 雖然每令牌費率較高,但總體令牌消耗下降,因為 GPT‑5.4 能以更少的令牌解決問題。
  • 更廣泛的工具生態系 – 工具搜尋讓代理能使用數千種可能的工具,而不會產生過高的令牌開銷。
  • 提升的可靠性 – 較低的幻覺率與更強的安全控制,使 GPT‑5.4 適用於高風險的專業領域,如法律分析、金融建模與醫療排程。

結論

OpenAI 的 GPT‑5.4 代表了前沿 AI 的重要進展,將最先進的推理、程式編寫、視覺與原生電腦使用結合於單一模型。其在專業、程式編寫與電腦使用基準測試中的效能提升,加上改進的令牌效率與安全功能,使其成為企業與開發者在尋求高品質、具成本效益的 AI 協助以處理複雜真實工作流程時的有力選擇。


來源

Sources