OpenAI GPT-5.2 发布说明
OpenAI 已推出 GPT-5.2,这是一个专为专业知识工作设计的模型系列。此次发布包含三个变体——GPT-5.2 Instant、GPT-5.2 Thinking 和 GPT-5.2 Pro——它们共同提升了通用智能、长上下文理解、代理工具调用和视觉能力。
专业知识工作和 GDPval
GPT-5.2 Thinking 是首个在 GDPval 基准上达到或超过人类专家水平的 OpenAI 模型,该基准衡量 44 种职业的明确指定知识工作任务。它在 70.9% 的比较中击败或持平顶尖行业专业人士。
专业任务的关键性能指标包括:
- 效率: GPT-5.2 Thinking 的输出速度超过专业专家的 11 倍,成本低于专业专家的 1%。
- 金融建模: 在内部初级投资银行分析师电子表格任务中,GPT-5.2 Thinking 得分 68.4%,比 GPT-5.1 的 59.1% 提高了 9.3%。
- 交付物: 该模型在生成劳动力规划模型、电子表格和演示文稿方面表现出更高的复杂度。
软件工程和编程
GPT-5.2 Thinking 在软件工程领域树立了新的最先进水平,在 SWE-Bench Pro(测试四种语言)上得分 55.6%,在 SWE-bench Verified 上得分 80%。
编程中的技术改进包括:
- 端到端执行: 在调试生产代码、实施功能请求和重构大型代码库方面的可靠性得到提升。
- 前端开发: 在非传统 UI 工作和 3D 元素方面的能力得到增强。
- 代理集成: 包括 Windsurf 首席执行官 Jeff Wang 在内的早期测试者指出,GPT-5.2 在代理编程方面代表了重大飞跃,使得脆弱的多代理系统能够合并为单个“超级代理”。
长上下文推理和视觉
GPT-5.2 Thinking 在最多 256k tokens 的上下文中的 4-needle MRCR 变体上达到接近 100% 的准确率,使其在深度文档分析方面相比 GPT-5.1 准确率显著提高。
视觉能力也得到了提升:
- 错误减少: 图表推理和软件界面理解的错误率降低了约一半。
- 空间感知: 模型对图像内相对布局和元素定位的理解更强,例如识别主板上的组件。
- 界面理解: 在 ScreenSpot-Pro 上,GPT-5.2 Thinking(启用 Python)得分 86.3%,而 GPT-5.1 Thinking 得分 64.2%。
数学、科学和抽象推理
GPT-5.2 Pro 和 Thinking 被定位为科学加速的领先模型:
- GPQA Diamond: GPT-5.2 Pro 在此研究生水平科学基准上得分 93.2%,GPT-5.2 Thinking 得分 92.4%。
- FrontierMath: GPT-5.2 Thinking 在 Tier 1–3 任务上树立了新的最先进水平,解决了 40.3% 的问题。
- 竞赛数学: Pro 和 Thinking 两个版本在 AIME 2025 上均达到 100%。
- ARC-AGI: GPT-5.2 Pro 是首个在 ARC-AGI-1(已验证)上突破 90% 阈值的模型,得分为 90.5%。在更具挑战性的 ARC-AGI-2(已验证)上,GPT-5.2 Pro 达到 54.2%。
工具调用和事实性
GPT-5.2 Thinking 在 Tau2-bench Telecom 上达到 98.7%,表明在多轮工具使用中具有高可靠性。在延迟敏感的情况下将 reasoning.effort='none' 设置时,其推理表现也优于 GPT-5.1 和 GPT-4.1。
关于事实性,在使用最大推理努力和搜索工具时,GPT-5.2 Thinking 的错误响应比 GPT-5.1 Thinking 少了 30%。
模型变体和可用性
OpenAI 已部署三个不同版本的模型以满足不同用户需求:
| 模型 | 主要用例 | 关键特征 |
|---|---|---|
| GPT-5.2 Instant | 日常工作、学习和翻译 | 快速、对话式且解释清晰 |
| GPT-5.2 Thinking | 复杂编码、长文档合成和数学 | 深度推理和精美输出 |
| GPT-5.2 Pro | 高难度问题和编程 | 最智能、最可信、延迟更高 |
API 定价和访问
GPT-5.2 可通过 Responses API 和 Chat Completions API 获得。
- 命名:
gpt-5.2(Thinking),gpt-5.2-chat-latest(Instant),以及gpt-5.2-pro(Pro)。 - 定价: 每 1M 输入 token 1.75 美元,每 1M 输出 token 14 美元(缓存输入享受 90% 折扣)。
- 推理努力: Pro 和 Thinking 模型现在支持第五级推理努力:
xhigh。
安全和内容保护
GPT-5.2 实施了“安全完成”研究,以在有用性与安全边界之间取得平衡。对涉及心理健康困扰、自残和情感依赖的响应进行了改进。
此外,OpenAI 正在推出一个年龄预测模型,以自动对未满 18 岁的用户应用内容保护。在心理健康评估中,GPT-5.2 Thinking 在自残方面得分 0.963,在心理健康基准方面得分 0.915,而 GPT-5.1 Thinking 得分为 0.684。
Sources
- OriginalIntroducing GPT-5.2