LLMs Can't Jump: Analyzing the Limits of AI Scientific Discovery
核心论点:LLMs 缺乏进行基础性“飞跃”的能力
在名为《LLMs Can't Jump》的立场论文中,作者 Tom Zahavy 认为,大语言模型(LLMs)在结构上无法创造新的基础公理,也无法做出重大科学突破所需的直觉飞跃。该论文以阿尔伯特·爱因斯坦的广义相对论公式作为主要案例研究,指出当观测数据匮乏时,LLMs 无法进行发明全新框架所需的“溯因推理”(abductive reasoning)。
Zahavy 指出,爱因斯坦所实现的“飞跃”——特别是等效原理——并非处理现有语言数据的产物,而是基于感官经验的物理直觉和思想实验。其核心观点是,由于 LLMs 是基于语言(人类经验的有损编码)而非与物理世界的直接交互进行训练的,它们缺乏模拟世界并进行基础性发明所需的内部实验所需的接地性(grounding)。
作者的澄清
在论文传阅后,Tom Zahavy 提供了关键的背景信息,以澄清其工作的范围和意图:
- 个人观点,而非公司政策: Zahavy 强调该论文是个人立场论文,不代表 Google DeepMind 的官方观点。
- 并非“死胡同”论点: 他澄清该论文并非旨在论证 LLMs 永远无法做出科学发现。他提到自己在 AlphaProof(首个获得 IMO 金牌的 AI 系统)方面的工作,以此证明 AI 可以并且将继续做出惊人的发现。
- 专注于特定能力: 该论文专门探讨 AI 要实现类似于广义相对论发明那样的飞跃需要具备什么条件,而不是声称 AI 不具备所有形式的科学进步能力。
技术批判与反论
关于 LLMs 无法“飞跃”的论点遭到了技术界的显著质疑,主要集中在三个领域:
1. 缺乏定量证据
批评者认为,该论文是一种修辞性的立场而非实证研究。一种突出的批评指出,“LLMs Can't Jump”这一主张缺乏定量证据支持,且对于什么构成“飞跃”缺乏严谨的定义。一种建议的测试方法是使用知识截止日期为 2025 年的 LLM,并尝试在信息极少的情况下重新推导 2026 年发表的科学结果。
2. 体现与感官经验的作用
虽然论文认为物理感觉和具身模拟(embodied simulation)对发现是必要的,但一些人认为这过度解读了广义相对论的类比。例如,量子力学中的能量量子化并非通过物理感觉发现的,而是通过数学上的实现——即发现量子化解决了黑体辐射谱问题。这表明“飞跃”可以在没有感官接地的情况下在抽象领域发生。
3. “移动的球门”现象
多位观察者指出,AI 能力的基准一直在不断移动。随着 LLMs 摧毁了现有的基准,智能的定义被推向了下一个无法触及的高峰——在这种情况下,就是“直觉飞跃”。这种观点表明,当前的局限性可能是架构或“控制装置”(环境)的功能,而非根本性的结构性不可能。
提出的解决方案与替代视角
为了克服感知中的“飞跃”局限性,研究者提出了几种理论路径:
- 世界模型与多模态接地: 论文认为世界模型是解决方案。然而,批评者指出,当前的多模态融合(整合图像/音频/视频)尚未在推理能力上产生普遍的阶跃式变化。
- 温度调节(Temperature Modulation): 有人建议调节 LLM 的 temperature——使用高 temperature 进行想法生成,使用低 temperature 进行批判——这可以模拟人类“幻觉”出一种可能性,然后应用严谨性来验证它的过程。
- 环境反馈循环: 将 LLMs 集成到物理世界的反馈循环中(例如在自动化化学研究中)可能会提供作者所声称缺失的接地性。
- 架构变革: 有观点认为 LLMs 从根本上是概率性的,缺乏在潜在空间(latent space)中进行“正交方向改变”的机制,而这对于直觉飞跃或幽默感是必要的。这将需要一种专门为实现“左转”而设计的新架构组件。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch