OpenAI Astra 指控:可能剽窃数学证明

OpenAI Astra 被指控吸收未发表的数学研究

OpenAI 的 Astra 模型正面临指控,称其可能通过在研究人员与 AI 之间的私人对话上进行训练,从而“偷窃”了未发表的数学证明。这场争议的核心是 sofic 和 hyperlinear groups 领域的领先专家 Andreas Thom,他认为 Astra 可能在关于 Gromov’s soficity conjecture 的工作上进行了训练——这是 OpenAI 宣布 Astra 已解决的十个重大数学问题之一。

根据 Valerio Capraro 的报道,该说法认为未发表的人类研究成果被吸收进了模型的训练数据中,并随后被 AI 作为独立的突破性成果呈现出来。这一事件紧随研究人员 Levent Alpöge 和 Tristan Buckmaster 提出的类似指控,表明这可能是一种潜在的知识产权吸收模式,而非孤立事件。

潜在剽窃的机制

批评者和观察者提出了几种这种指控的“窃取”可能发生的方式。主要理论是,研究人员使用前沿模型进行头脑风暴或完善证明,从而向模型输入了高价值、未发表的数据。如果这些数据随后被用于训练模型的后续迭代版本,AI 就可以“重新发现”该证明并将其作为自己的成果呈现。

平行构建与数据收割

一些观察者注意到 OpenAI 的数据生成存在可疑的时机。Hacker News 上的一位评论者指出,在一段可能存在高价值数学证明的训练数据时期之后,OpenAI 从一个仍在训练中的模型生成了 3000 亿个输出 token,这表明存在一种“平行构建”的过程,以掩盖发现的来源。

“秘密配方”风险

使用基于云端的 LLM 进行高风险研究会产生一个根本性的脆弱点。因为这些模型通常会通过用户提示词来“改进服务”,研究人员实际上是在向 AI 实验室提供他们的“秘密配方”,而这些配方随后可能被分享给竞争对手或被声称是模型的突破性成果。

社区观点与反驳观点

这些指控在技术和学术界引发了关于 AI 驱动发现的伦理问题的广泛辩论。

支持 AI 驱动进步的论点

有人认为,发现的效用大于归属权。从这个角度来看,如果一个 AI 工具加速了原本需要数十年才能实现的突破,那么无论谁获得荣誉,结果对科学而言都是净正向的。其他人则认为 AI 可能是在扮演协作者的角色,即人类提供初始步骤(A $\rightarrow$ B $\rightarrow$ C)并由 AI 完成最后的飞跃(C $\rightarrow$ D)。

反对模型能力的论点

其他批评者认为,主要问题不仅在于归属权,还在于对模型能力的误导性陈述。通过将“偷窃”来的证明作为独立的发现,AI 实验室可能会夸大模型的感知智能水平,以推动估值和 IPO,从而助长了 AGI 已实现的虚假叙事。

对指控的怀疑论

一些怀疑论者认为,目前提供的证据是轶事性的。他们指出,这些指控是基于研究人员与 AI 就该主题进行了讨论,这一事实,但不一定意味着他们当时已经拥有了完整的证明,而 AI 随后将其复制了出来。

对学术研究的影响

这场争议导致了一些研究人员在对待 AI 工具的方式上发生了转变。一些人现在开始在 GitHub 等平台上通过时间戳记录自己的工作,以在与 LLM 交互之前为自己的原始发现创建纸质记录。其他人则表示担心,由于训练数据缺乏透明度,研究人员无法验证自己的工作是否在未经许可的情况下被使用,他们认为这种差距被 GDPR 对个人身份信息(PII)的关注而非对独特智力贡献的关注所加剧了。

Sources

相关