OpenAI GPT-5.2 发布:推动科学与数学发展

OpenAI 推出了 GPT-5.2 Pro 和 GPT-5.2 Thinking,这些模型专门针对高精度的科学和数学工作进行优化。这些模型旨在通过提供更一致且可靠的多步骤逻辑、数据分析和实验设计推理能力,加速科学研究。

高精度推理与基准性能

GPT-5.2 Pro 和 GPT-5.2 Thinking 展示了在通用推理和抽象方面的显著提升,OpenAI 表示这些是通用智能(AGI)发展的基础。这些能力使模型能够在长链思考中保持一致性,并在不同领域中实现泛化。

模型在专门基准测试上的表现如下:

  • GPQA Diamond: 在这个面向研究生的、被称为“Google-proof”的问答基准,涵盖物理、化学和生物学,GPT-5.2 Pro 获得了 93.2% 的得分,GPT-5.2 Thinking 获得了 92.4%。这些结果是在未启用工具且推理力度设为最大时获得的。
  • FrontierMath (Tier 1–3): GPT-5.2 Thinking 通过解决该专家级数学评估中 40.3% 的问题,创下了新的最高水平。

在科学工作流中的应用

强大的数学推理是技术工作可靠性的基础,使模型能够避免在模拟、统计、预测和建模中累积错误。这些改进直接转化为实际的科学工作流,包括编码和实验设计。

在具有公理化理论基础的领域,如理论计算机科学和数学,这些模型可以通过以下方式帮助研究人员:

  • 探索证明
  • 检验假设
  • 识别可能需要大量人工努力才能发现的关联

人类监督在 AI 驱动研究中的作用

OpenAI 强调,GPT-5.2 模型并非独立的研究者。人类专家的判断、验证和领域理解仍然至关重要,因为模型仍可能出现错误或依赖未说明的假设。

AI 辅助科学的可靠进展依赖于以验证、透明和协作为优先的工作流。在这种新兴的研究实践模式中,GPT-5.2 作为支持推理和早期探索的工具,而人类研究者仍承担正确性、解释和上下文的责任。

Sources