Anthropic Toy Models of Superposition 研究

Anthropic 推出了一个名为 "Toy Models of Superposition" 的研究项目,该项目调查了神经网络如何表示比其可用维度更多的特征。这种被称为 superposition 的现象允许模型在输入特征是稀疏的条件下,比线性模型更有效地压缩信息。

The Mechanism of Superposition

当模型表示的特征数量超过其维度允许的范围时,就会发生 superposition。在一个 toy model 中——具体来说是在具有稀疏输入特征的合成数据上训练的小型 ReLU 网络——Anthropic 研究人员发现,模型可以在单个维度中存储多个特征。这种压缩是通过将特征视为空间中的方向来实现的,这是模型为了解决这些特征之间的冲突而学习的一种策略。

The Role of Sparsity and Nonlinearity

Sparsity 是 superposition 的基本要求。当输入特征是稀疏的(意味着一次只有少数特征处于激活状态)时,模型可以将更多特征打包进其隐藏层中。然而,这种压缩是有代价的:特征之间的 "interference"(干扰)。

为了解决这种干扰,模型利用了 nonlinear filtering(非线性过滤)。在 ReLU (Rectified Linear Unit) 激活函数中,模型可以过滤掉由其他特征的干扰所产生的噪声,从而有效地在压缩表示中隔离出同一个特征。

Implications for Model Interpretability

对 superposition toy models 的研究表明,模型的内部表示并不一定是哪些特征处于激活状态的一一对应映射。这意味着一个复杂模型的内部状态可以表示比模型宽度多得多的特征数量,这使得理解模型内部权重如何表示特定概念的过程变得更加复杂。

Sources

相关