OpenAI 首次证明提交

OpenAI 使用内部推理模型尝试了 First Proof 挑战中的全部十个问题,这是一项旨在测试 AI 在专门领域中生成可检验、端到端论证能力的研究级数学竞赛。此里程碑展示了模型进行长链推理的能力以及解决此前多年未解问题的潜力。

模型在 First Proof 问题上的表现

OpenAI 认为模型的至少五个证明尝试——具体为第 4、5、6、9、10 题——有很高的正确概率。虽然还有其他若干尝试正在审查中,但团队在官方评论和社区分析后,已撤回最初认为第 2 题的尝试是正确的观点。

James R. Lee 研究员指出模型能力在训练过程中有明显提升:

‘我们目前正在训练一款新模型,主要关注提升其思考的严谨程度,目标是让模型能够连续思考数小时并对其结论保持高度自信。当 First Proof 问题公布时,它看起来是完美的试验平台……它已经能够解决其中的两个问题(#9 和 #10)。随着训练的进行,它的能力不断提升,最终在我们估计中——至少又解决了另外三个。’

方法论与人工监督

  • 策略指导: 人类建议重新尝试在早期尝试中显得有成效的策略。
  • 细化: 根据专家反馈,要求模型扩展或澄清证明的某些部分,以帮助验证。
  • 验证支持: 通过内部模型与 ChatGPT 的来回交互,用于格式、风格和验证。
  • 选择: 当出现多个尝试时,人类根据判断挑选最佳版本。

OpenAI 承认这是一场“快速冲刺”,且该过程缺乏正式评估的受控环境,并表达了希望与 First Proof 组织者合作,以建立更严格的未来框架的愿望。

前沿研究在 AI 评估中的作用

OpenAI 认为新颖的前沿研究是评估下一代 AI 模型的最有效方式。公司指出,标准基准往往无法捕捉研究中最困难的方面,例如:

  • 维持长链推理。
  • 选择合适的抽象。
  • 处理歧义 在问题陈述中。
  • 生成经得起专家审查的论证。

推理能力的背景

这些结果基于一系列在数学和科学领域的 AI 推理进展:

  • 2025 年 7 月: 通用推理模型在国际数学奥林匹克中取得金牌水平的成绩(35/42 分)。
  • 2025 年 11 月: 分享了关于 GPT-5 在物理、生物和数学等领域加速科学的案例研究。
  • 近期进展: GPT-5.2 提出了理论物理中胶子振幅公式的候选表达式,随后该表达式被内部模型正式证明并得到作者验证。

Sources