Anthropic Claude 自动形式化费马大定理
TL;DR
Anthropic 的 Claude 模型在短短 11 天内生成了完整的、经 Lean 验证的费马大定理证明,编写了 1300 万行代码并证明了 29,500 个中间定理,这表明 AI 现在可以自主形式化高度复杂的数学结果。
成果概述
Claude 在很大程度上无需人类干预,将 Andrew Wiles 的证明翻译成了机器可检查的形式。生成的 Lean 证明已发布在 GitHub 上,并由 Kevin Buzzard 进行了评审,他确认其与 Mathlib 对该定理的陈述一致。
"This extraordinary autoformalization achievement… proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics." – Kevin Buzzard
技术流程
自动化证明生成
- Claude 运行了 11 天,生成了 1300 万行 Lean 代码。
- 系统总共证明了 30,300 个定理,其中 29,500 个出现在最终的 FLT 证明中。
- 数十个 Claude agents 协作,每个 agent 处理定义、中间引理或更高级别的定理。
Prove2Me 协作平台
Prove2Me 是一个开放的协作形式化平台,对此次成功至关重要:
- 定理陈述的有向无环图 (DAG) – 引导 agents 到下一个逻辑目标并防止项目状态丢失。
- 分离陈述与证明的存储方式 – 加速了 Lean 编译并减少了资源使用。
- 自然语言描述 – 实现了对现有引理的高效搜索和复用。
这些特性减轻了内存退化问题,并允许许多 agents 进行并行工作。
与先前工作的对比
- 社区为形式化 FLT 拟定的蓝图(86 页)预计需要数年的工作;Claude 在不到两周的时间内完成了任务。
- 最终的 Lean 代码库 比 Mathlib 大 5 倍以上,Mathlib 是作为基础使用的形式化数学主要库。
- 早期的 FLT 自动形式化尝试均以失败告终,仅为最终证明贡献了约 7% 的非模板代码行。
对数学的影响
减轻验证负担
- 自动形式化可以显著缩短验证复杂证明所需的时间,这在历史上需要数月或数年的工作量。
- Kevin Buzzard 指出,这一步使社区更接近于自动形式化现代数学文献,从而可能根除隐藏的错误并减轻审稿人的工作量。
对 AI 生成数学的信任
- 形式化证明提供了明确的正确性保证,补充了人类可读的阐述。
- 随着 AI 生成的猜想增加,拥有一个能够同时生成 Lean 证明的自动化流水线,可以使验证过程具备可扩展性。
扩展到其他定理
- Anthropic 展示了使用相同的协作设置,在三天内完成了 Vinogradov’s Three-Primes Theorem 的形式化。
- 配合适当的脚手架,主要的数学结果可以通过消费级 AI 订阅来完成形式化。
未来方向与支持
- Anthropic 和其他实验室正在扩大对外部研究人员的免费或折扣访问权限,并为大规模形式化项目提供专门的资助。
- 目前的工作旨在改进 Lean、Mathlib 和 Prove2Me 等协作工具,以降低未来自动形式化的门槛。
致谢
这项工作建立在数十年的数学发展基础之上——从 Wiles 的原始证明到 Imperial College 的 FLT 项目以及更广泛的 Lean 社区。Kevin Buzzard 提供了评审和反馈,证明过程遵循了 Darmon、Diamond 和 Taylor 的阐述。
资源
- GitHub 仓库 – 完整的 Lean 证明及随附的说明:https://github.com/anthropics/fermats-last-theorem
- Prove2Me 论文 – 协作平台的详细描述:Chen et al., 2026, arXiv 2608.28433.
- 相关 Anthropic 文章 – Riemann hypothesis 的自动形式化、自动化对齐研究以及其他 AI 驱动的科学进展。