Terence Tao:AI时代的数学

Terence Tao:AI时代的数学

从证明稀缺到证明过剩的转变

Terence Tao 认为,数学正在进入一个类似于 20 世纪初基础数学危机时期的动荡时期。核心挑战不再仅仅是 AI 是否能解决数学问题,而是数学界应如何应对一个研究级数学任务由 AI 工具完成的未来。Tao 警告说,如果缺乏文化和政策层面的变革,该领域将从“证明稀缺”时代转向“证明过剩”时代,从而导致“证明消化不良”——即经过验证的结果积累速度超过了人类理解或将其纳入确定性理论的速度。

AI 能力猜想

为了分析 AI 的影响,Tao 提出了 AI 能力猜想 (AI Capability Conjecture):即在不久的将来,在一定程度的人类监督和成本投入下,AI 工具将能够以非平庸的成功率和可接受的质量完成研究级的数学任务。

虽然这一猜想的真实性仍有争议,但 Tao 指出 First Proof 挑战提供了实证证据。在 2026 年 5 月的一项测试中,四种 AI 框架针对十个全新的研究级问题进行了测试,其中七个问题以出版级质量得到解决,每个问题的计算成本在 10 美元到 1,000 美元之间。

重新定义数学目标与价值

Tao 认为,如果 AI 可以处理证明的技术执行工作,数学界必须明确定义数学研究的目标。从历史上看,这些目标(解决问题、构建理论、培养数学家)是正相关的。然而,Tao 警告说,过度优化单一指标——例如解决未解决问题的数量——会触发 古德哈特定律 (Goodhart's Law):“当一个指标变成目标时,它就不再是一个好的指标了。”

为了说明这一点,Tao 追溯了“解决问题”这一目标的演变过程:

  1. 第一次尝试: 尽可能多地解决未解决的问题。(风险:产生大量错误的解法)。
  2. 第二次尝试: 解决并验证正确性。(风险:AI 生成了人类无法理解的证明)。
  3. 第三次尝试: 解决、验证并确保清晰的交流。(风险:AI 润色的阐述可能会消除帮助人类学习和消化困难概念的“自然摩擦”)。
  4. 第四次尝试: 解决、验证、交流并获得社区认可。(风险:社区认可是一个缓慢的人类过程,无法通过 AI 进行优化)。
  5. 最终尝试: 解决、验证、交流并将结果纳入该领域的确定性理论中。

瓶颈:证明消化与规范化

数学过程中最有价值的部分是 规范化 (canonicalization)——即结果被社区消化并成为确定性教科书和参考资料一部分的阶段。这一阶段最不容易被 AI 优化,也是所有阶段中最慢的。

Tao 指出了由 AI 引起的几种新兴“阻抗失配”:

  • 验证缺口 (Verification Gap): AI 生成的证明在等待人类验证时不断积累。
  • 阐述缺口 (Exposition Gap): 已验证的证明在等待可读的、以人为中心的撰写工作。
  • 评审缺口 (Review Gap): 传统的同行评审系统被海量的 AI 生成投稿所淹没。
  • 规范化缺口 (Canonicalization Gap): 已发表的证明数量过多,以至于社区无法将其综合成一个凝聚的理论。

对数学界的建议

为了减轻这些风险,Tao 建议在专业实践中进行几项转变:

  • 规范负责任的披露: 作者应公开披露 AI 工具的使用情况,以避免隐蔽使用和同行批评。
  • 转变激励机制: 降低与“第一个”解决问题(证明生成)相关的声望,并提高对阐述、出版和规范化(证明消化)的价值重视。
  • 严格的验证标准: Tao 提出了一个经验法则:如果作者无法就其研究结果进行清晰的、专家级的报告,那么无论 AI 是否验证了证明,该结果都不应发表。

社区观点与反论

围绕 Tao 的论点的讨论凸显了“暴力破解式”的 AI 成功与真正的数学洞察力之间的紧张关系。一些贡献者认为,目前的 AI 能力代表了大模型对解的搜索,而不是发明新的数学工具。

“我将其视为一个大模型+框架在执行广泛的暴力搜索,并尝试各种解法直到成功……这与发明能够打破旧问题的全新数学工具是非常不同的。”

其他担忧还包括“秘密数学”的可能性,即具备顶尖 AI 数学能力的实体为了战略优势而囤积研究结果,而不是为了社区验证而发表它们。

“我怀疑数学即将变得大大降低开放性……我们将看到数学的碎片化和‘秘密数学’的囤积。”

最后,有人建议,对于 AI 容易生成的证明(例如那些可以用 Lean 验证的证明),传统的同行评审过程可能会变得过时,因为这些输出应该被视为公共知识,而不是专利研究。

Sources