Anthropic 将语言模型分解为可理解的组件

Anthropic 推出了一种将语言模型分解为被称为“特征”(features)的可解释组件的方法,从而能够更深入地理解神经网络如何处理信息。这种方法通过识别与特定、一致的概念相对应的神经元激活的线性组合,解决了 AI 的“黑盒”性质,而不是依赖于往往与模型行为缺乏一致关系的单个神经元。

从单个神经元转向特征

神经网络中的单个神经元通常是多语义的(polysemantic),这意味着单个神经元可能会在多个不相关的上下文中激活。例如,一个小语言模型中的单个神经元可能会同时针对学术引用、英语对话、HTTP 请求和韩语文本进行激活。由于单个神经元与网络行为之间没有一致的关系,因此很难将其用于诊断故障模式或验证模型安全性。

为了解决这个问题,Anthropic 的研究人员将“特征”确定为主要分析单位。特征是神经元激活的模式或线性组合。通过使用字典学习(dictionary learning),研究人员能够将一层 512 个神经元分解为 4,000 多个特征。这些特征代表了不同的概念,例如:

  • DNA 序列
  • 法律语言
  • HTTP 请求
  • 希伯来语文本
  • 营养声明

在孤立地分析单个神经元的激活时,大多数这些模型属性是不可见的。

特征可解释性的验证

Anthropic 使用两种主要方法验证了这些特征的可解释性:

人类评估

双盲人类评估人员对神经元和特征的可解释性进行了评分。结果显示,特征获得了比单个神经元显著更高的可解释性评分。

自动可解释性

研究人员使用大语言模型(LLM)为小模型中的特征生成简短描述。然后,根据另一个模型仅凭该描述预测特征激活的能力对这些描述进行评分。特征再次获得了比神经元更高的评分,证实了特征激活及其对模型行为的下游影响具有一致的解释。

模型转向与泛化

特征为有针对性的模型转向(model steering)提供了机制。人工激活特定特征会导致模型行为以可预测的方式发生变化,从而允许研究人员根据内部表示来操纵模型输出。

此外,研究表明,这些学习到的特征在不同模型之间在很大程度上是通用的。这表明,从研究一个模型中的特征所学到的经验可能会泛化到其他模型。研究人员还发现,学习到的特征数量可以作为一个“旋钮”来改变模型内部视图的分辨率:一小组特征提供了一个粗略、易于理解的视图,而一组更大的特征则会揭示更多微妙的模型属性。

对 AI 安全与扩展性的影响

这项工作是 Anthropic 对机械可解释性(Mechanistic Interpretability)投资的一部分,这是对 AI 安全的长期研究赌注。通过克服不可解释神经元的障碍,这种方法为从内部监控和转向模型行为提供了一条路径,这对于企业和社会的采用所需的可靠性和可靠性至关重要。

目前的成功已在小模型上得到了验证。下一个主要挑战是将这种方法扩展到前沿模型(frontier models),这些模型显著更大且更复杂。Anthropic 表示,解释大语言模型的主要障碍现在是一个工程挑战,而非科学挑战。

Sources

相关