OpenAI GPT-5 發布說明
OpenAI 已推出 GPT-5,這是一個統一的 AI 系統,相較於先前模型在智能上有顯著飛躍。透過整合一個即時路由器,該路由器能動態在快速高效模型與更深度推理模型(GPT-5 thinking)之間選擇,該系統在編碼、數學、寫作和健康領域提供最先進的表現。
統一系統架構
GPT-5 作為一個統一系統運作,由三個核心組件組成:一個用於標準查詢的智慧高效模型、一個稱為「GPT-5 thinking」的較深度推理模型(用於複雜問題),以及一個即時路由器。路由器根據對話複雜度、工具需求、使用者意圖(例如「好好想想這個」這類提示)和對話類型來決定使用哪個模型。
為確保持續可用性,當主要使用量限制被達到時,每個模型的「mini」版本會處理查詢。OpenAI 計畫將這些分離的功能在未來整合為單一模型。
技術能力與領域表現
GPT-5 在數個關鍵基準測試中達到新的最先進(SOTA)成績,顯示在專業領域的智能有所提升:
- 數學: 94.6% 在 AIME 2025(不使用工具)。
- 編碼: 74.9% 在 SWE-bench Verified 和 88% 在 Aider Polyglot。
- 多模態理解: 84.2% 在 MMMU。
- 健康: 46.2% 在 HealthBench Hard。
- 一般科學: GPT-5 pro 達成 88.4% 在 GPQA(不使用工具)。
編碼與開發
GPT-5 是 OpenAI 迄今為最強的編碼模型,在偵測大型倉庫和複雜前端生成方面有具體進步。該模型對美學設計(包括字體和間距)有直覺的理解,使其能從單一提示生成響應式網站和應用。
健康與醫療資訊
GPT-5 在 HealthBench 上的得分顯著高於先前模型。它透過主動標記疑慮並提出澄清問題,作為一個積極的思考夥伴運作。該模型會根據使用者的地理位置、知識水平和情境調整回應,以提供更安全、更可靠的資訊。
創意寫作與表達
該模型在處理結構歧義和文學深度方面展現出增強的能力,例如維持自由詩或無韻抑揚格五步詩,使其在起草專業報告、電子郵件和備忘錄時更為有效。
可靠性、事實性與誠實度
GPT-5 相較於其前身,在幻覺和欺騙行為方面引入了顯著的減少:
- 事實性: 回應包含事實錯誤的可能性比 GPT-4o 低約 45%。使用「thinking」模式時,GPT-5 包含事實錯誤的可能性比 OpenAI o3 低約 80%。
- 開放式事實性: 在 LongFact 和 FActScore 基準測試中,「GPT-5 thinking」產生的幻覺次數比 o3 少六倍。
- 誠實度: 在移除多模態提示中圖像的測試中(CharXiv),GPT-5 只有 9% 的時間會對不存在的圖像給出確定答案,而 o3 為 86.7%。在生產流量中,欺騙率從 o3 的 4.8% 下降至 GPT-5 的 2.1%。
安全與行為改進
安全完成範式
OpenAI 已超越基於簡單拒絕的安全訓練,採用「安全完成」方法。此方法教導模型在安全界限內提供最有可能的有用答案,這可能涉及部分答案或高層次概覽。如果必須拒絕,模型會被訓練解釋原因並提供安全的替代方案。
降低奉承
GPT-5 的設計旨在減少過度熱情的同意與減少不必要的表情符號使用。在有針對性的評估中,奉承回應從 14.5% 降低至低於 6%,目標是達到類似「擁有博士級智慧的樂於助人的朋友」的語氣。
生物風險防護
由於「GPT-5 thinking」模型在生物與化學領域被歸類為「高能力」,OpenAI 已實施多層防禦系統。這包括與 CAISI 和 UK AISI 等夥伴進行 5,000 小時的紅隊測試、始終啟用的分類器以及推理監控器,以將生物風險降至最低。
GPT-5 Pro 與存取層級
GPT-5 pro 取代了 OpenAI o3-pro。它利用縮放的並行測試時間計算來為最複雜的任務提供延伸推理。在對 1,000 個具經濟價值的推理提示進行評估時,外部專家有 67.8% 傾向於選擇 GPT-5 pro 而非「GPT-5 thinking」,並指出主要錯誤減少了 22%。
可用性:
- 免費使用者: 可存取 GPT-5,在使用量限制被達到後轉為 GPT-5 mini。
- Plus、Team 和 Pro 使用者: 使用量限制更高。Pro 訂閱者可無限制存取 GPT-5,並獨家取得 GPT-5 pro 的存取權。
- 企業與教育機構: 存取權將在下週陸續推出。
- 開發者存取: 可透過 Codex CLI 供 Pro、Plus 和 Team 使用者使用。
Sources
- OriginalIntroducing GPT-5