Richard Sutton 对 AI 创造力与发现的看法
AI 研究员 Richard Sutton 认为,虽然生成式 AI 是一种具有变革性的模仿技术,但它从根本上无法实现真正的创造力和科学发现。根据 Sutton 的观点,监督学习的核心局限性在于,它产生的输出要么是新颖的,要么是优秀的,但无法同时做到这两点。
生成式 AI 中新颖性与优良性的悖论
生成式 AI 系统,包括大语言模型 (LLMs) 和图像生成器,旨在模仿其训练数据中的模式。Sutton 解释说,当这些系统产生“优秀”的内容时,是因为它们成功地利用了高质量的源材料。而当它们产生“新颖”的内容时,通常是随机过程的结果。
在大多数实际应用中,这种权衡是一种特性而非缺陷。例如,当用户要求对文档进行摘要时,新颖性是不可取的;任何超出源材料的内容都被归类为“幻觉”。然而,对于科学和数学领域,这种局限性是至关重要的。在这些领域,进步需要输出结果同时具备新颖性和正确性(优良性)。
发现的三步机制
Sutton 认为,真正的发现不是模式识别或预测的产物,而是一个由三个必要步骤组成的“发现”过程:
- Variation (变化):生成各种潜在的解决方案或轨迹(可以部分是有信息的,部分是盲目的)。
- Evaluation (评估):针对明确的目标或目标进行测试,以查看哪些方案可行。
- Selective Retention (选择性保留):保留成功的变化,并丢弃失败的部分。
Sutton 指出,这一循环是科学方法、通过自然选择进行的生物进化以及心理学中的操作性条件反射的基础。他明确指出,这种机制在标准的监督学习、backpropagation 和 gradient descent 中是缺失的,因为这些系统缺乏一个运行时评估步骤来判断它们所生成的新颖性。
区分模仿型 AI 与发现型 AI
Sutton 将“普通”生成式 AI 与具备真正发现能力的系统区分开来。他引用了几个通过引入评估机制而超越了简单模仿的 AI 案例:
- AlphaGo 和 AlphaZero:这些系统利用自我博弈和明确的胜负目标来发现原创策略(例如 AlphaGo 的“第 37 手”)。
- AlphaFold 和 AlphaProof:这些系统在科学和数学领域做出了实际的进展。
- Claude-Code:被引用为在编程领域带来真正进步的系统。
当人类使用生成式 AI 创建多张图像并随后选择最佳的一张时,“人类+AI 系统”完成了发现过程,由人类提供了缺失的评估步骤。
技术改进:持续反向传播 (Continual Backpropagation)
针对深度学习的局限性,Sutton 提到标准的 backpropagation 依赖于随机初始化来进行变化,但这种变化仅在开始时发生一次。为了保持随时间进行发现和学习的能力,Sutton 的团队引入了“continual backpropagation”,即定期将较少使用的神经元重新初始化为随机权重,从而使可塑性和变化得以持续。
社区观点与反驳点
围绕 Sutton 观点的讨论突显了当前 AI 状态的一些技术细节:
"最成功的应用(如编程)并不是纯粹 LLM/生成式建模的结果。它们来自于通过智能体框架 (agentic harness) 实现的闭环。生成-测试-选择性优化循环是科学工作的核心模式。"
批评者和评论员认为,Sutton 所做的区分主要是在原始预训练模型与“智能体”系统之间。一些人认为,训练后阶段 (post-training) 和强化学习 (RLHF) 已经包含了他在描述中提到的变化、评估和选择性保留循环。其他人则指出,组合泛化 (compositional generalization)——即模型以新的方式重新组合已知的抽象概念——即使在没有正式的发现循环的情况下,也可能构成一种有意义的新颖性。
最终,Sutton 的“战斗号召”是呼吁 AI 社区向实现创造力和发现的完全自动化迈进,通过向 AI 系统提供明确的目标,使它们能够评估自己的输出并自主地参与科学进步。