Anthropic 研究:分布式表示、组合与叠加

Anthropic 研究表明,神经网络中的分布式表示可以分为两个截然不同的概念:组合(composition)与叠加(superposition)。虽然两者都能让网络表示信息,但它们基于不同的原理运行,并产生了一种权衡,使得它们在函数如何线性计算以及网络如何泛化方面存在根本性的张力。

分布式表示在机械可解释性中的作用

将表示分解为独立的组件对于理解神经网络和克服“维度灾难”至关重要。通过分析模型如何表示数据,研究人员可以从不透明的权重转向分析人员可以实际理解的独立成分分析。

组合 vs. 叠加:概念框架

Anthropic 将“组合”与“叠加”区分开来,将其视为在神经元集合中表示信息的两种不同方式。这两种分布式表示的概念在泛化能力以及可以从中线性计算出的函数类型方面具有不同的属性。

组合

组合涉及通过结合不同的独立特征来表示一个概念。例如,如果一个网络需要表示不同颜色的形状,它可能会使用一组专门用于“红色”和“正方形”的神经元,并将它们结合起来表示“红色正方形”。

叠加

叠加是一种机制,通过将特征视为空间中的方向而非单个神经元,使网络能够表示比其维度(神经元数量)更多的特征。这允许网络将比传统局部编码允许的更多信息压缩到更少数量的神经元中。

分析表示编码

为了说明这些差异,Anthropic 参考了 Thorpe (1989) 的工作。Thorpe 关于“局部”、“半局部”、“半分布式”和“高分布式”编码的示例——传统上被视为从局部到分布式的光谱——可以被重新构想为在两个不同维度上的变化:叠加与组合。

通过关注二进制激活值,该研究简化了可能性空间,同时保持了足够丰富的环境,以探索这两种机制如何相互作用以及网络如何表示特征。

Sources

相关