Anthropic 研究:通过字典学习分解语言模型
Anthropic 引入了一种使用字典学习分解语言模型的方法,旨在识别“特征”(features)——即神经元激活的线性组合——这些特征代表了特定的、可解释的概念。这种方法允许研究人员通过将高维激活分解为单语义单元进行分析,从而理解 Transformer 模型的内部表示。
字典学习与单语义性概念
字典学习被用于将一层神经元分解为数量更多的特征。在提供的研究中,Anthropic 将一个拥有 512 个神经元的层分解成了 4,000 多个特征。这一过程表明,单个神经元可能并不是 AI 模型内部逻辑最有效的分析单元,因为在孤立观察单个神经元时,许多模型属性是不可见的。
Transformer 模型中的可解释特征
通过识别这些特征,研究人员可以从多语义神经元(polysemantic neurons,即针对多个不相关概念产生响应的神经元)转向单语义特征(monosemantic features,即代表单一、清晰概念的单元)。在其小型 Transformer 模型中识别出的特征对应于一系列多样化的概念,包括:
- DNA 序列
- 法律语言
- HTTP 请求
- 希伯来语文本
- 营养声明
对神经网络可解释性的影响
这项研究建立在神经科学、机器学习和统计学领域解释高维系统的现有努力之上。通过提供一种寻找这些分析单元的机制,Anthropic 旨在开辟一条路径,将复杂的神经网络分解为人类可理解的部分,从而提高前沿模型处理信息的方式的透明度。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch