Anthropic 研究:通过字典学习分解语言模型

Anthropic 引入了一种使用字典学习分解语言模型的方法,旨在识别“特征”(features)——即神经元激活的线性组合——这些特征代表了特定的、可解释的概念。这种方法允许研究人员通过将高维激活分解为单语义单元进行分析,从而理解 Transformer 模型的内部表示。

字典学习与单语义性概念

字典学习被用于将一层神经元分解为数量更多的特征。在提供的研究中,Anthropic 将一个拥有 512 个神经元的层分解成了 4,000 多个特征。这一过程表明,单个神经元可能并不是 AI 模型内部逻辑最有效的分析单元,因为在孤立观察单个神经元时,许多模型属性是不可见的。

Transformer 模型中的可解释特征

通过识别这些特征,研究人员可以从多语义神经元(polysemantic neurons,即针对多个不相关概念产生响应的神经元)转向单语义特征(monosemantic features,即代表单一、清晰概念的单元)。在其小型 Transformer 模型中识别出的特征对应于一系列多样化的概念,包括:

  • DNA 序列
  • 法律语言
  • HTTP 请求
  • 希伯来语文本
  • 营养声明

对神经网络可解释性的影响

这项研究建立在神经科学、机器学习和统计学领域解释高维系统的现有努力之上。通过提供一种寻找这些分析单元的机制,Anthropic 旨在开辟一条路径,将复杂的神经网络分解为人类可理解的部分,从而提高前沿模型处理信息的方式的透明度。

Sources

相关