OpenAI GPT-5.2 版本說明

OpenAI 已推出 GPT-5.2,一個專為專業知識工作設計的模型系列。此版本包含三個變體——GPT-5.2 InstantGPT-5.2 ThinkingGPT-5.2 Pro——共同提升了通用智慧、長上下文理解、代理工具調用和視覺能力。

專業知識工作與 GDPval

GPT-5.2 Thinking 是首個在 GDPval 基準上達到或超越人類專家水平的 OpenAI 模型,該基準衡量 44 個職業的明確指定知識工作任務。在 70.9% 的比較中,它擊敗或持平頂尖行業專業人士。

專業任務的關鍵效能指標包括:

  • 效率: GPT-5.2 Thinking 產出的速度超過專業人士的 11 倍,且成本低於專業人士的 1%。
  • 財務建模: 在內部初級投資銀行分析師的試算表任務中,GPT-5.2 Thinking 得分 68.4%,比 GPT-5.1 的 59.1% 提高 9.3%。
  • 交付成果: 該模型在生成人力規劃模型、試算表和簡報方面展現出更高的精緻度。

軟體工程與編程

GPT-5.2 Thinking 在軟體工程上建立了新的最先進水準,在 SWE-Bench Pro(測試四種語言)上得分 55.6%,在 SWE-bench Verified 上得分 80%。

編程中的技術改進包括:

  • 端到端執行: 在調試生產程式碼、實作功能請求以及重構大型程式碼基礎方面的可靠性提升。
  • 前端開發: 在非傳統 UI 工作和 3D 元素方面的能力增強。
  • 代理整合: 包括 Windsurf 首席執行官 Jeff Wang 在內的早期測試者指出,GPT-5.2 在代理編程方面代表了重大飛躍,使得脆弱的多代理系統能夠合併為單一的「超級代理」。

長上下文推理與視覺

GPT-5.2 Thinking 在最多 256k tokens 的上下文中,於 4-needle MRCR 變體上達到近乎 100% 的準確率,使其在深度文件分析上比 GPT-5.1 準確許多。

視覺能力也已升級:

  • 錯誤減少: 圖表推理和軟體介面理解的錯誤率降低了約一半。
  • 空間感知: 模型對圖像內相對佈局和元素定位有更強的掌握,例如識別主機板上的元件。
  • 介面理解: 在 ScreenSpot-Pro 上,GPT-5.2 Thinking 得分 86.3%(啟用 Python),而 GPT-5.1 Thinking 得分 64.2%。

數學、科學與抽象推理

GPT-5.2 Pro 和 Thinking 被定位為科學加速的領先模型:

  • GPQA Diamond: GPT-5.2 Pro 在此研究生級科學基準上達到 93.2%,GPT-5.2 Thinking 達到 92.4%。
  • FrontierMath: GPT-5.2 Thinking 在 Tier 1–3 任務上設定了新的最先進水準,解決了 40.3% 的問題。
  • 競賽數學: Pro 和 Thinking 兩個版本在 AIME 2025 上均達到 100%。
  • ARC-AGI: GPT-5.2 Pro 是首個在 ARC-AGI-1 (Verified) 上突破 90% 門檻的模型,達到 90.5%。在更具挑戰性的 ARC-AGI-2 (Verified) 上,GPT-5.2 Pro 達到 54.2%。

工具調用與事實性

GPT-5.2 Thinking 在 Tau2-bench Telecom 上達到 98.7%,顯示在多輪工具使用方面具有高可靠性。在延遲敏感情況下將 reasoning.effort='none' 設定時,其推理表現也優於 GPT-5.1 和 GPT-4.1。

就事實性而言,在使用最大推理努力和搜尋工具時,GPT-5.2 Thinking 的錯誤回應比 GPT-5.1 Thinking 少了 30%。

模型變體與可用性

OpenAI 已部署三個不同版本的模型以符合不同使用者需求:

模型 主要使用案例 關鍵特性
GPT-5.2 Instant 日常工作、學習與翻譯 快速、對話式且解釋清晰
GPT-5.2 Thinking 複雜編程、長文件合成與數學 深度推理與輸出精緻
GPT-5.2 Pro 高難度問題與編程 最智慧、最可信賴、延遲較高

API 定價與存取

GPT-5.2 可透過 Responses API 與 Chat Completions API 使用。

  • 命名: gpt-5.2 (Thinking)、gpt-5.2-chat-latest (Instant) 和 gpt-5.2-pro (Pro)。
  • 定價: 每 1M 輸入標記 $1.75,每 1M 輸出標記 $14(快取輸入享有 90% 折扣)。
  • 推理努力: Pro 和 Thinking 模型現在支援第五個推理努力等級:xhigh

安全與內容保護

GPT-5.2 實施「安全完成」研究,以平衡有用性與安全界限。對於涉及心理健康困擾、自傷和情感依賴的回應,已進行改進。

此外,OpenAI 正在推出一個年齡預測模型,以自動對未滿 18 歲的使用者套用內容保護。在心理健康評估中,GPT-5.2 Thinking 在自傷方面得分 0.963,在心理健康基準上得分 0.915,而 GPT-5.1 Thinking 則為 0.684。

Sources