OpenAI GPT-5.2 发布说明

OpenAI 已推出 GPT-5.2,这是一个专为专业知识工作设计的模型系列。此次发布包含三个变体——GPT-5.2 InstantGPT-5.2 ThinkingGPT-5.2 Pro——它们共同提升了通用智能、长上下文理解、代理工具调用和视觉能力。

专业知识工作和 GDPval

GPT-5.2 Thinking 是首个在 GDPval 基准上达到或超过人类专家水平的 OpenAI 模型,该基准衡量 44 种职业的明确指定知识工作任务。它在 70.9% 的比较中击败或持平顶尖行业专业人士。

专业任务的关键性能指标包括:

  • 效率: GPT-5.2 Thinking 的输出速度超过专业专家的 11 倍,成本低于专业专家的 1%。
  • 金融建模: 在内部初级投资银行分析师电子表格任务中,GPT-5.2 Thinking 得分 68.4%,比 GPT-5.1 的 59.1% 提高了 9.3%。
  • 交付物: 该模型在生成劳动力规划模型、电子表格和演示文稿方面表现出更高的复杂度。

软件工程和编程

GPT-5.2 Thinking 在软件工程领域树立了新的最先进水平,在 SWE-Bench Pro(测试四种语言)上得分 55.6%,在 SWE-bench Verified 上得分 80%。

编程中的技术改进包括:

  • 端到端执行: 在调试生产代码、实施功能请求和重构大型代码库方面的可靠性得到提升。
  • 前端开发: 在非传统 UI 工作和 3D 元素方面的能力得到增强。
  • 代理集成: 包括 Windsurf 首席执行官 Jeff Wang 在内的早期测试者指出,GPT-5.2 在代理编程方面代表了重大飞跃,使得脆弱的多代理系统能够合并为单个“超级代理”。

长上下文推理和视觉

GPT-5.2 Thinking 在最多 256k tokens 的上下文中的 4-needle MRCR 变体上达到接近 100% 的准确率,使其在深度文档分析方面相比 GPT-5.1 准确率显著提高。

视觉能力也得到了提升:

  • 错误减少: 图表推理和软件界面理解的错误率降低了约一半。
  • 空间感知: 模型对图像内相对布局和元素定位的理解更强,例如识别主板上的组件。
  • 界面理解: 在 ScreenSpot-Pro 上,GPT-5.2 Thinking(启用 Python)得分 86.3%,而 GPT-5.1 Thinking 得分 64.2%。

数学、科学和抽象推理

GPT-5.2 Pro 和 Thinking 被定位为科学加速的领先模型:

  • GPQA Diamond: GPT-5.2 Pro 在此研究生水平科学基准上得分 93.2%,GPT-5.2 Thinking 得分 92.4%。
  • FrontierMath: GPT-5.2 Thinking 在 Tier 1–3 任务上树立了新的最先进水平,解决了 40.3% 的问题。
  • 竞赛数学: Pro 和 Thinking 两个版本在 AIME 2025 上均达到 100%。
  • ARC-AGI: GPT-5.2 Pro 是首个在 ARC-AGI-1(已验证)上突破 90% 阈值的模型,得分为 90.5%。在更具挑战性的 ARC-AGI-2(已验证)上,GPT-5.2 Pro 达到 54.2%。

工具调用和事实性

GPT-5.2 Thinking 在 Tau2-bench Telecom 上达到 98.7%,表明在多轮工具使用中具有高可靠性。在延迟敏感的情况下将 reasoning.effort='none' 设置时,其推理表现也优于 GPT-5.1 和 GPT-4.1。

关于事实性,在使用最大推理努力和搜索工具时,GPT-5.2 Thinking 的错误响应比 GPT-5.1 Thinking 少了 30%。

模型变体和可用性

OpenAI 已部署三个不同版本的模型以满足不同用户需求:

模型 主要用例 关键特征
GPT-5.2 Instant 日常工作、学习和翻译 快速、对话式且解释清晰
GPT-5.2 Thinking 复杂编码、长文档合成和数学 深度推理和精美输出
GPT-5.2 Pro 高难度问题和编程 最智能、最可信、延迟更高

API 定价和访问

GPT-5.2 可通过 Responses API 和 Chat Completions API 获得。

  • 命名: gpt-5.2(Thinking),gpt-5.2-chat-latest(Instant),以及 gpt-5.2-pro(Pro)。
  • 定价: 每 1M 输入 token 1.75 美元,每 1M 输出 token 14 美元(缓存输入享受 90% 折扣)。
  • 推理努力: Pro 和 Thinking 模型现在支持第五级推理努力:xhigh

安全和内容保护

GPT-5.2 实施了“安全完成”研究,以在有用性与安全边界之间取得平衡。对涉及心理健康困扰、自残和情感依赖的响应进行了改进。

此外,OpenAI 正在推出一个年龄预测模型,以自动对未满 18 岁的用户应用内容保护。在心理健康评估中,GPT-5.2 Thinking 在自残方面得分 0.963,在心理健康基准方面得分 0.915,而 GPT-5.1 Thinking 得分为 0.684。

Sources