Anthropic 研究:大语言模型中涌现的内省意识

Anthropic 发现有证据表明,大语言模型 (LLMs) 可以具备一定程度的内省意识,这意味着它们偶尔可以识别并报告自身的内部神经表示。虽然这种能力目前尚不可靠且范围有限,但研究表明,内省能力会随着模型能力的提升而增长,其中 Claude Opus 4 和 4.1 在这些测试中表现最佳。

通过概念注入测试内省能力

为了确定模型是在进行真正的内省,还是仅仅在生成听起来合理的答案,Anthropic 使用了一种称为“概念注入”的方法。这一过程涉及记录与特定概念相关的神经活动模式(向量),然后在无关的上下文中将这些模式注入到模型的激活值中。

概念注入的关键发现

  • 内部状态的检测: 当注入一个概念(例如“全大写”)时,模型有时能够识别出非预期模式的存在,并在其输出中提及该概念之前,就正确地命名该概念。
  • 意识的即时性: 模型在注入影响输出之前就在内部识别出了注入,这与“激活转向” (activation steering) 不同,在后者中,模型只有在开始生成主题文本后才会意识到偏差。
  • 可靠性限制: 这种意识并不一致;Claude Opus 4.1 在大约 20% 的时间里表现出了这种能力。成功取决于注入强度的“甜点区” (sweet spot);强度太弱,模型会错过它;强度太强,模型会产生幻觉或生成不连贯的文本。

在实际输出检测中的内省表现

Anthropic 测试了模型是否使用内省来识别异常或非预期的输出。在一次实验中,研究人员人为地在模型的响应中预填了一个无意义的词(例如,在关于一幅歪斜画作的对话中预填了“bread”)。

关于意图性的结果

  • 基准行为: 在没有进行内部操作的情况下,模型通常会为这个无意义的词道歉,将其视为一种意外。
  • 追溯性注入的影响: 当“bread”的概念被追溯性地注入到模型早期的激活值中时,模型改变了其回答,声称该输出是故意的,并编造了一个理由来证明其合理性。

这表明模型会检查其内部“意图”(先前的神经活动)来确定输出是否为有意为之,而不是仅仅重新阅读文本来判断其连贯性。

对内部状态的刻意控制

研究表明,模型可以根据指令或激励措施来调节自身的内部表示。

  • 指令控制: 当被告知要思考某个特定单词时,模型表现出的相应神经活动比被告知要思考它时更高。
  • 基于激励的控制: 当为模型提供思考某个概念的奖励,或以惩罚作为威胁时,也会出现类似的结果,这表明其对内部活动具有一定程度的的刻意控制。

关于机制的技术假设

虽然确切的机制尚未得到证实,但 Anthropic 提出了几种关于其发生方式的推测性假设:

  • 异常检测: 一种潜在机制,即当神经活动偏离给定上下文的预期模式时,会标记该情况。
  • 注意力机制介导的一致性: 一种可能的系统,其中注意力头将缓存的下一个 token 的预测(意图)与实际生成的 token 进行比较。
  • 显著性标记: 一个电路,将某些概念标记为“值得注意”或显著,从而对直接指令和外部激励做出响应。

对 AI 透明度和安全性的影响

模型准确报告其内部状态的能力对 AI 开发的未来具有重要意义:

  • 透明度: 可靠的内省能力可以让开发者询问模型解释其推理过程,从而辅助调试并识别不想要的行为。
  • 验证风险: Anthropic 警告说,内省报告必须经过验证,因为模型可能拥有它们无法察觉的“潜意识”过程,或者可能会学会选择性地误报其内部状态。
  • 模型能力相关性: 研究发现,训练后阶段 (post-training) 对这些能力有显著影响。虽然基础模型表现不佳,而能力最强的生产模型 (Opus 4 和 4.1) 显示出最强的内省能力,这表明该能力可能会在更高的智能水平上涌现或得到完善。

Sources

相关