OpenAI 的纳维-斯托克斯千禧难题声明与大语言模型生成数学的伦理问题

OpenAI 声称其内部大语言模型解决了纳维-斯托克斯问题

OpenAI 于 2026 年 9 月 1 日发布博客文章,声称其未公开的模型解决了纳维-斯托克斯存在性与光滑性问题,这是七个千禧年难题之一。该模型在该问题上生成了 270 万条消息约 1300 亿个输出 token,在所有尝试的问题中总计生成了 490 万条消息约 3000 亿个 token。最终的 Lean 形式化证明于 2026 年 9 月 6 日使用第二代模型(GPT-6 Astra)完成。若按公开 API 价格计算,该 token 使用量的费用约为 1500 万美元

纽约大学与 Anthropic 研究人员的竞逐声明

纽约大学的 Tristan Buckmaster 与 Anthropic 的 Levent Alpöge 于 2026 年 9 月 8 日发布了一份 PDF,描述了他们长达一年的努力,该工作高度依赖 Anthropic 的 Codex(GPT-5.6 Sol)。他们报告称在 2026 年 8 月 15 日取得突破,并指控 OpenAI 可能未经同意访问了他们的会话数据。Buckmaster 的声明关键摘录如下:

“我问过该模型是否在训练中使用过或访问过我们在 Codex 中的会话……我被告知该模型并未查询用户数据。” “我并未指控任何人。” Buckmaster 的团队提出愿意发表他们的成果,但 OpenAI 拒绝将 Alpöge 列为共同作者,理由是与 Anthropic 存在竞争关系。

OpenAI 的回应与时间线

OpenAI 的博客解释称,9 月 1 日他们听到了关于两个千禧年问题被解决的传闻。受此传闻激励,他们启动了一项自动化“代理”项目,在 88 小时内 完成了问题的解决,并额外投入了 17 小时 的 Lean 验证。他们的声明强调:

“在公开发布之前,我们并未看到他们的任何工作。虽然可能性很小,但我们无法排除他们使用我们产品所产生的去标识化数据,可能帮助改进了我们的模型。” OpenAI 还指出,他们的证明与纽约大学/Anthropic 的结果存在差异,尤其是在欧拉情形(强制 vs. 无强制)方面。

Hacker News 社区的反应

数据隐私问题主导讨论

  • @_bobm@bob1029 质疑 OpenAI 如何从数十亿用户会话中筛选数据,以及此类数据是否可能被纳入训练流程。
  • @jwr 对“为所有人改进模型”开关的有效性表示怀疑,并质疑退出是否真能防止数据使用。
  • @vb-8448 直言不讳地指出,任何发送给大语言模型的数据最终都会被用于改进模型,无论服务条款如何规定。

人工智能驱动数学的成本与可及性

  • @TrackerFF 指出,以 1500 万美元的计算预算解决一个千禧年问题,对大多数研究人员而言目前仍遥不可及,可能催生两极分化的研究生态。
  • @keremk 认为,如果竞争对手可能率先获得奖项,那么投入如此巨额资金是理性的,将这一事件视为一场由谣言驱动的竞赛。

技术可行性与模型能力

  • @civvv 指出,大语言模型在训练数据中已有大量前期成果时表现优异,但怀疑它们在缺乏人类指导的情况下能否生成真正新颖的数学。
  • @pietz 认为 OpenAI 的模型很可能未纳入纽约大学团队的近期草稿,因为该工作是在 GPT-5.6 上完成的,而该模型在 9 月初之前尚未被整合进其内部模型。

伦理与战略影响

  • @sdcfgy 建议在机密研究中避免使用大语言模型服务,将这种情形比作将实验笔记本交给一个不可信的第三方。
  • @Simran-B 质疑其商业逻辑:花费 1500 万美元赢得 100 万美元的奖金,更像是展示能力而非盈利。
  • @stn_za 将其与传统数学研究类比,指出研究人员基于彼此已发表的工作进行构建,但强调当人工智能能即时响应谣言时,其速度与规模存在显著差异。

该事件揭示的 AI 驱动科学发现的本质

  1. 谣言驱动的计算资源分配 – OpenAI 团队基于一个谣言,在数日内为单一问题分配了巨量资源。这类似于安全研究中的趋势:一旦漏洞被披露,就会迅速引发大规模的利用尝试。
  2. 数据使用政策的不透明性 – 即使公司声称不会“查询”用户数据,去标识化会话数据可能影响模型更新的可能性仍处于灰色地带,引发法律与伦理问题。
  3. 进入门槛的经济壁垒 – 尝试解决一个千禧年问题所需的 1000 万至 1500 万美元计算成本,对大多数学术团队而言是不可承受的,可能导致突破性成果集中在资金充足的实验室中。
  4. 人机协作与竞争 – 纽约大学/Anthropic 团队曾数月使用 OpenAI 自己的 Codex,但当 OpenAI 启动平行项目时,他们感到被边缘化。这一事件凸显了在多个团队依赖同一 AI 服务时,明确信用归属、数据共享与共同作者规范的必要性。
  5. 验证流程的演进 – OpenAI 使用 Lean 进行形式化验证,展示了日益成熟的科研工作流:大语言模型生成猜想,代理探索证明空间,定理证明器验证结果。这一流程能否推广到缺乏大量前期文献的问题,仍有待观察。

社区待解问题

  • AI 提供商应如何处理可能包含未发表突破的用户数据?
  • 何种治理结构可确保多个团队使用同一商业大语言模型时的公平署名?
  • AI 驱动的证明搜索成本是否会下降到足以实现普及化,还是将固化高影响力数学领域的垄断?
  • 形式化验证工具能否跟上 AI 生成的证明草稿数量,确保正确性而无需高昂的人力投入?

本文综合了原始公告、纽约大学/Anthropic 的声明以及 Hacker News 上获赞最高的评论,旨在提供对 OpenAI 纳维-斯托克斯声明在技术、伦理与经济维度上的全面概述。

Sources

相关