使用影响函数研究大语言模型的泛化能力

Anthropic 开发了一种方法,通过使用特征值修正的克罗内克分解近似曲率(EK-FAC)近似,将影响函数扩展到大语言模型(LLMs)上。这种方法使研究人员能够识别出对特定模型行为贡献最大的训练样本,从而提供一种反事实视角,理解如果将某个特定序列添加到训练集中,模型参数和输出将如何变化。

使用 EK-FAC 扩展影响函数

传统上,为 LLM 计算影响函数非常困难,因为它需要计算逆海森向量积(IHVP)。EK-FAC 近似使得该计算速度提升数个数量级,同时保持与传统影响函数估计器相当的准确性。该方法使模型分析规模达到高达 520 亿参数。

为了进一步降低计算候选训练序列梯度的计算成本,Anthropic 采用了两种特定的算法技术:

  • TF-IDF 过滤:用于缩小待分析的候选训练序列范围。
  • 查询批处理:用于优化同时处理多个查询的效率。

探究 LLM 的泛化模式

利用这些可扩展的影响函数,Anthropic 研究了 LLM 泛化中的多个关键领域,包括:

  • 影响模式的稀疏性:分析少数训练样本如何驱动特定输出。
  • 规模带来的抽象能力:观察随着模型规模增大,模型抽象信息的能力如何提升。 -- 数学与编程能力:确定模型执行数学推理和编程任务能力的来源。
  • 跨语言泛化:理解在一种语言上训练如何影响其他语言的表现。
  • 角色扮演行为:识别触发特定角色采纳的训练数据。

泛化中的局限性

尽管模型展现出复杂的泛化形式,但研究发现一个关键局限:当提示中关键短语的顺序被颠倒时,影响函数会衰减至接近零。这表明模型对泛化模式的理解对训练数据中信息的顺序高度敏感。

对模型安全与风险缓解的意义

影响函数为研究社区提供了一个强大的工具,用于理解模型的内部逻辑,并更清晰地洞察 LLM 的训练过程。通过识别对特定行为影响最大的训练样本,开发者可以更好地理解并缓解模型输出相关的风险。

Sources

相关