OpenAI GPT-5.4 發布:具備 1M 令牌上下文的統一推理、程式編寫與電腦使用模型
OpenAI GPT-5.4 發布:具備 1M 令牌上下文的統一推理、程式編寫與電腦使用模型
TL;DR
OpenAI 發布了 GPT‑5.4,這是其在專業工作領域最強大且最高效的前沿模型,現在可在 ChatGPT(作為 Thinking)、API 與 Codex 中使用,並提供效能更高的 Pro 變體。該模型加入了原生電腦使用功能、最高 1 M 令牌上下文、更佳的工具搜尋,以及更強大的推理、程式編寫與知識工作能力,於各種基準測試中提供更高的準確度、更低的令牌使用量與更快的速度。
發布概覽
OpenAI 在 2026 年 3 月 5 日宣布推出 GPT‑5.4。該模型在三條產品線上部署:
- ChatGPT – 作為 GPT‑5.4 Thinking(標準)與 GPT‑5.4 Pro(最高效能)。
- API – 可透過
gpt-5.4與gpt-5.4-pro端點存取。 - Codex – 整合了新的程式編寫導向功能。
GPT‑5.4 結合了近期在推理、程式編寫與代理工作流程方面的進展,繼承了 GPT‑5.3‑Codex 的程式編寫優勢,同時在試算表、簡報、文件與工具豐富的環境中提升效能。
主要技術改進
統一推理與規劃
- 前置規劃 – 在 ChatGPT 中,模型現在會在產生回應前先列出其思考流程,讓使用者能在回應過程中調整計畫。
- 更長上下文 – 支援最高 1 M 令牌,使代理能在極長的任務中保持前後一致性。
- 降低令牌消耗 – 相較於 GPT‑5.2,在相同推理下使用顯著更少的令牌,降低成本與延遲。
原生電腦使用
- 首個具備內建電腦使用功能的通用模型,允許代理透過如 Playwright 等函式庫控制應用程式,並可從螢幕截圖發出滑鼠/鍵盤操作。
- 工具搜尋 – 不再預先載入所有工具定義,模型可按需取得工具定義,於大型工具密集工作流程中將令牌使用量減少 ≈47 %。
- 工具呼叫準確度 – 在 Toolathon 與 τ2‑bench 等基準測試中提升多步驟工具使用的表現,以更少的互動回合達成更高的準確度。
視覺與感知
- 引入
original影像細節等級(最高 10.24 M 像素)並將high等級擴展至 2.56 M 像素,提升定位、點擊精度與密集影像理解。 - 在 MMMU‑Pro(未使用工具)上達到 81.2 %,使用工具時為 82.1 %,超過 GPT‑5.2。
程式編寫增強
- 結合 GPT‑5.3‑Codex 的程式編寫優勢與全新的推理與工具功能。
- Codex 中的 /fast mode 可提供最高 1.5× 更快的令牌速度,且不犧牲智慧。
- 推出實驗性的 Playwright (Interactive) 技能,用於網頁/Electron 應用的視覺除錯與自動化測試。
基準表現
| 基準測試 | GPT‑5.4 | GPT‑5.3‑Codex | GPT‑5.2 |
|---|---|---|---|
| GDPval(知識工作) | 83.0 % | – | 70.9 % |
| SWE‑Bench Pro(程式編寫) | 57.7 % | – | 55.6 % |
| OSWorld‑Verified(桌面電腦使用) | 75.0 % | 74.0 % | 47.3 % |
| WebArena‑Verified(瀏覽器使用) | 67.3 % | – | 65.4 % |
| BrowseComp(網路搜尋) | 82.7 % (standard) / 89.3 % (Pro) | 77.3 % | 65.8 % |
| MMMU‑Pro(視覺) | 81.2 % (no tools) / 82.1 % (with tools) | – | 79.5 % |
| Toolathlon(工具使用) | 54.6 % | – | 45.7 % |
| 投資銀行試算表任務(內部) | 87.3 % | – | 68.4 % |
| 簡報品質(人工評分) | 68.0 % preferred over GPT‑5.2 |
所有評估皆在推理努力設定為 xhigh 的情況下執行,除非另有說明。
真實世界能力
專業知識工作
- 在 44 種職業的 GDPval 比較中,達到或超過業界專業人士 83 % 的表現。
- 降低事實錯誤:單一主張出錯的機率降低 33 %,完整回應出錯的機率降低 18 %(相較於 GPT‑5.2)。
- 產生更高品質的試算表、簡報與文件,人工評分者更偏好 GPT‑5.4 的輸出,因其美觀與功能多樣性。
電腦使用代理
- 在桌面導航上達到業界領先的成功率(75 % 對比 GPT‑5.2 的 47 %),以及網路互動基準測試(在 Online‑Mind2Web 上最高 92.8 %)。
- 透過工具搜尋與平行工具產出,支援協調的多工具工作流程,降低延遲。
- 在財產稅門戶任務中展示了 95 % 的首次成功率,完成會話的速度提升 ~3×,且使用的令牌減少 ~70 %。
程式編寫與開發
- 在 SWE‑Bench Pro 上超越 GPT‑5.3‑Codex,且延遲更低。
- Playwright (Interactive) 技能在程式碼生成過程中提供視覺除錯與自動化測試,示例為僅用單一提示構建的完整主題樂園模擬。
安全性與治理
- 根據 OpenAI 的備援框架,將其歸類為 高網路能力,並擴大監控、可信存取控制,以及對零資料保留(ZDR)環境中高風險請求的非同步阻斷。
- 推出開源的 CoT 可控性 評估,顯示 GPT‑5.4 隱藏思考鏈的能力低,強化了 CoT 監控的有效性。
- 持續的優化可能導致 ZDR 客戶偶爾出現誤判的拒絕,因為分類器在改進中。
可用性與定價
- ChatGPT – GPT‑5.4 Thinking 已對 Plus、Team 與 Pro 用戶上線;GPT‑5.4 Pro 可供 Pro 與 Enterprise 計畫使用。舊版 GPT‑5.2 Thinking 仍保留至 2026 年 6 月 5 日。
- API –
gpt-5.4(標準)與gpt-5.4-pro(最高效能)已上線。每 M 令牌的定價為:輸入 $2.50、快取輸入 $0.25、輸出 $15(標準);Pro 變體為輸入 $30、輸出 $180。 - 上下文視窗 – 預設 272 K 令牌;實驗性的 1 M 令牌視窗可透過
model_context_window與model_auto_compact_token_limit啟用,超過 272 K 的使用量將以 2 倍的正常費率計費。
對開發者與企業的影響
- 更高生產力 – 模型的規劃、更長上下文與高效工具使用,減少完成複雜任務所需的互動回合數。
- 成本效益 – 雖然每令牌費率較高,但總體令牌消耗下降,因為 GPT‑5.4 能以更少的令牌解決問題。
- 更廣泛的工具生態系 – 工具搜尋讓代理能使用數千種可能的工具,而不會產生過高的令牌開銷。
- 提升的可靠性 – 較低的幻覺率與更強的安全控制,使 GPT‑5.4 適用於高風險的專業領域,如法律分析、金融建模與醫療排程。
結論
OpenAI 的 GPT‑5.4 代表了前沿 AI 的重要進展,將最先進的推理、程式編寫、視覺與原生電腦使用結合於單一模型。其在專業、程式編寫與電腦使用基準測試中的效能提升,加上改進的令牌效率與安全功能,使其成為企業與開發者在尋求高品質、具成本效益的 AI 協助以處理複雜真實工作流程時的有力選擇。
來源
- OpenAI 部落格文章 – Introducing GPT‑5.4(2026‑03‑05)– https://openai.com/index/introducing-gpt-5-4
Sources
- OriginalIntroducing GPT-5.4