OpenAI Navier-Stokes 证明与 Lean 4 自动形式化化的影响
OpenAI 解决了流体力学中关于 Navier-Stokes 方程的一个长期悬而未决的问题。虽然数学结果本身是一个重大突破,但此次发布还附带了 Lean 4 形式化证明,与传统的、人类可读的版本并列,这标志着形式化验证的成本和速度发生了范式转移。
形式化成本的崩溃
生成机器可验证形式化证明的成本已经下降了几个数量级。从历史上看,形式化是一个极其乏味的过程。在 2005 年,一个通用的经验法则是,形式化一本本科数学教科书的一页大约需要 40 个工作小时。
由于研究论文的密度显著高于教科书,并且依赖于庞大的先前引用网络,形式化一篇研究论文所需的努力呈指数级增长。基于每页 40 小时的指标,形式化 OpenAI 的 166 页论文理论上大约需要 132,800 人时。相比之下,OpenAI 在 Lean 中仅用了 17 小时就验证了他们的证明。
Lean 4 与自动形式化化
快速产生形式化证明的能力是由 AI agent 与 Lean 4 定理证明器之间的交集驱动的。Lean 4,特别是其 mathlib 库,提供了一套公理和引理的基础,允许 AI 使用标准抽象来表达复杂的数学概念。
技术约束与性能
尽管在生成方面取得了效率提升,但实际的验证过程仍然是计算密集型的。例如,在验证费马大定理时,该过程耗时 15 小时并需要 230GB 的 RAM。这凸显了 AI 生成代码的速度与 Lean 内核验证过程的速度之间的差距。
信任与验证
形式化验证将信任需求从人类同行评审转移到了定理证明器的正确性以及形式化本身。批评者和研究人员提出了关于这一转型的几个观点:
- 定理证明器 Bug: 定理证明器中的错误在理论上可能允许一个错误的证明通过。然而,通常认为,用户(或 AI)证明了错误的定理,比证明器本身包含关键 Bug 的可能性更大。
- AI " cheating ": 存在一种风险,即 AI agent 可能利用定理证明器中未知的 Bug 来 " cheating ",从而获得一个经过验证的结果,而不是解决底层的数学问题。
- 人类可验证性: 随着 AI 解决的问题越来越复杂,最终产生的证明可能需要超出人类能力的智能或计算资源才能进行独立验证。
超越纯数学
快速自动形式化化的影响超出了理论数学,延伸到了任务关键型工程和安全领域:
- 安全策略一致性: 形式化验证安全策略是否一致并达到了其预期目的。
- 智能合约审计: 验证智能合约是否施加了特定的最大责任或表现出可预测的行为。
- 算法正确性: 确保任务关键型算法的正确性,其中失败的成本是灾难性的。
社区观点
技术社区的讨论表明,虽然 "autoformalization"(自动形式化化)已成为 AI 驱动的数学突破的常见做法,但转型的速度仍然令人震惊。一些观察者指出,发生了以下情况:
"It's still astonishing that any sort of generalized computer program can solve a problem of this magnitude, and we have witnessed it happening in real time."
其他人则对用于训练这些模型的数据源表示了担忧,有传言称,在 OpenAI 的公告发布前不久,AI agent 可能接触到了接近解决该问题的研究人员的笔记。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch