OpenAI GPT-5.2 版本說明
OpenAI 已推出 GPT-5.2,一個專為專業知識工作設計的模型系列。此版本包含三個變體——GPT-5.2 Instant、GPT-5.2 Thinking 和 GPT-5.2 Pro——共同提升了通用智慧、長上下文理解、代理工具調用和視覺能力。
專業知識工作與 GDPval
GPT-5.2 Thinking 是首個在 GDPval 基準上達到或超越人類專家水平的 OpenAI 模型,該基準衡量 44 個職業的明確指定知識工作任務。在 70.9% 的比較中,它擊敗或持平頂尖行業專業人士。
專業任務的關鍵效能指標包括:
- 效率: GPT-5.2 Thinking 產出的速度超過專業人士的 11 倍,且成本低於專業人士的 1%。
- 財務建模: 在內部初級投資銀行分析師的試算表任務中,GPT-5.2 Thinking 得分 68.4%,比 GPT-5.1 的 59.1% 提高 9.3%。
- 交付成果: 該模型在生成人力規劃模型、試算表和簡報方面展現出更高的精緻度。
軟體工程與編程
GPT-5.2 Thinking 在軟體工程上建立了新的最先進水準,在 SWE-Bench Pro(測試四種語言)上得分 55.6%,在 SWE-bench Verified 上得分 80%。
編程中的技術改進包括:
- 端到端執行: 在調試生產程式碼、實作功能請求以及重構大型程式碼基礎方面的可靠性提升。
- 前端開發: 在非傳統 UI 工作和 3D 元素方面的能力增強。
- 代理整合: 包括 Windsurf 首席執行官 Jeff Wang 在內的早期測試者指出,GPT-5.2 在代理編程方面代表了重大飛躍,使得脆弱的多代理系統能夠合併為單一的「超級代理」。
長上下文推理與視覺
GPT-5.2 Thinking 在最多 256k tokens 的上下文中,於 4-needle MRCR 變體上達到近乎 100% 的準確率,使其在深度文件分析上比 GPT-5.1 準確許多。
視覺能力也已升級:
- 錯誤減少: 圖表推理和軟體介面理解的錯誤率降低了約一半。
- 空間感知: 模型對圖像內相對佈局和元素定位有更強的掌握,例如識別主機板上的元件。
- 介面理解: 在 ScreenSpot-Pro 上,GPT-5.2 Thinking 得分 86.3%(啟用 Python),而 GPT-5.1 Thinking 得分 64.2%。
數學、科學與抽象推理
GPT-5.2 Pro 和 Thinking 被定位為科學加速的領先模型:
- GPQA Diamond: GPT-5.2 Pro 在此研究生級科學基準上達到 93.2%,GPT-5.2 Thinking 達到 92.4%。
- FrontierMath: GPT-5.2 Thinking 在 Tier 1–3 任務上設定了新的最先進水準,解決了 40.3% 的問題。
- 競賽數學: Pro 和 Thinking 兩個版本在 AIME 2025 上均達到 100%。
- ARC-AGI: GPT-5.2 Pro 是首個在 ARC-AGI-1 (Verified) 上突破 90% 門檻的模型,達到 90.5%。在更具挑戰性的 ARC-AGI-2 (Verified) 上,GPT-5.2 Pro 達到 54.2%。
工具調用與事實性
GPT-5.2 Thinking 在 Tau2-bench Telecom 上達到 98.7%,顯示在多輪工具使用方面具有高可靠性。在延遲敏感情況下將 reasoning.effort='none' 設定時,其推理表現也優於 GPT-5.1 和 GPT-4.1。
就事實性而言,在使用最大推理努力和搜尋工具時,GPT-5.2 Thinking 的錯誤回應比 GPT-5.1 Thinking 少了 30%。
模型變體與可用性
OpenAI 已部署三個不同版本的模型以符合不同使用者需求:
| 模型 | 主要使用案例 | 關鍵特性 |
|---|---|---|
| GPT-5.2 Instant | 日常工作、學習與翻譯 | 快速、對話式且解釋清晰 |
| GPT-5.2 Thinking | 複雜編程、長文件合成與數學 | 深度推理與輸出精緻 |
| GPT-5.2 Pro | 高難度問題與編程 | 最智慧、最可信賴、延遲較高 |
API 定價與存取
GPT-5.2 可透過 Responses API 與 Chat Completions API 使用。
- 命名:
gpt-5.2(Thinking)、gpt-5.2-chat-latest(Instant) 和gpt-5.2-pro(Pro)。 - 定價: 每 1M 輸入標記 $1.75,每 1M 輸出標記 $14(快取輸入享有 90% 折扣)。
- 推理努力: Pro 和 Thinking 模型現在支援第五個推理努力等級:
xhigh。
安全與內容保護
GPT-5.2 實施「安全完成」研究,以平衡有用性與安全界限。對於涉及心理健康困擾、自傷和情感依賴的回應,已進行改進。
此外,OpenAI 正在推出一個年齡預測模型,以自動對未滿 18 歲的使用者套用內容保護。在心理健康評估中,GPT-5.2 Thinking 在自傷方面得分 0.963,在心理健康基準上得分 0.915,而 GPT-5.1 Thinking 則為 0.684。
Sources
- OriginalIntroducing GPT-5.2