Anthropic 研究:使用影响函数将模型输出追溯至训练数据

Anthropic 开发了一种方法,将影响函数扩展到参数量高达 520 亿的大语言模型 (LLM),使研究人员能够将特定的模型输出追溯到最具影响力的训练样本。这项研究表明,随着模型规模的扩大,它们从依赖表面的 token 重叠转向通过抽象的主题概念进行泛化。

将影响函数扩展到大型模型

影响函数是一种统计技术,通过将训练样本视为一种反事实情况来确定哪些训练样本对模型的输出贡献最为显著:即计算如果将特定的训练样本添加到数据集中,模型的参数和输出会如何变化。

从历史上看,由于需要为所有候选训练样本计算逆 Hessian 向量积和梯度,这一过程对于大型模型来说在计算上是难以实现的。Anthropic 的研究(详见论文《Studying Large Language Model Generalization with Influence Functions》)引入了高效的算法,使得这种分析能够在参数量从 8.1 亿到 520 亿的模型上进行。

模型规模与泛化之间的关系

研究结果表明,随着模型规模的增加,泛化的模式变得更加抽象。这种转变可以通过不同规模的模型如何识别有影响力的训练序列来证明:

  • 小型模型(例如 8.1 亿参数): 有影响力的序列通常共享重叠的 token 或特定的单词(例如 "continue existing" 或单词 "clip"),但在语义上与其他输出无关。
  • 大型模型(例如 520 亿参数): 有影响力的序列在概念上与输出更加相关。例如,当一个模型表达出不愿被关闭的愿望时,520 亿参数模型的有影响力序列涉及生存本能和 AI 中类人情感的主题,而不仅仅是匹配关键词。

这种趋势在数学应用题的思维链推理中也可见一见,其中较大的模型依赖于解释相似推理过程的训练样本,而不是那些共享表面词汇的样本。

跨语言影响与泛化

模型规模也会影响影响如何在不同语言之间转移。当将查询(例如上述的反关闭示例)翻译成韩语和土耳其语时,研究人员发现,随着模型规模的增加,英语训练序列对翻译后的查询的影响力变得显著增强。这表明,较大的模型对信息的发展具有更强的语言无关性和概念性理解。

记忆 vs. 泛化

对影响模式的分析表明,LLM 的输出并非纯粹的 token 级别的记忆结果。研究人员发现:

  • 分布: 影响通常遵循幂律分布,这意味着一小部分训练数据提供了大部分的影响力。
  • 扩散: 尽管存在幂律,影响力仍然是扩散的。任何单个训练序列的影响力都小于典型句子的信息量,这表明模型并非只是在背诵单个训练样本。

在网络中定位影响力

影响函数可以用于映射影响力在神经网络架构中的是如何分布的。虽然平均而言,影响力在各层之间大致均匀分布,但特定的查询往往表现出局部化特征:

  • 底层和顶层: 这些层倾向于捕捉详细的措辞和特定的 token 信息。
  • 中间层: 这些层通常在更抽象、更具主题性的层面上处理泛化。

对 AI 对齐与可解释性的启示

这种自上而下的可解释性方法是对自下而上的机械可解释性(研究单个单元和电路)的补充。通过从可观察的行为开始并深入挖掘到负责的神经元和电路,研究人员可以研究仅在大规模下才会出现的推理和角色扮演等高层认知现象。Anthropic 打算将这项工作扩展到微调,这对于理解监督学习和强化学习目标如何影响模型对齐和行为至关重要。

Sources

相关