Anthropic Softmax Linear Units (SoLU) 研究

Anthropic 引入了 Softmax Linear Units (SoLU),这是一种用于替换 MLP 层中标准激活函数的方案,旨在增加对人类可理解的概念、短语或类别的神经元响应数量。这种架构上的变化在不显著增加整体机器学习性能成本的情况下,提高了模型的可解释性。

The Softmax Linear Unit (SoLU) 架构

SoLU 旨在替换 Transformer 中多层感知器 (MLP) 层中的传统激活函数。通过实施这一变化,Anthropic 研究人员发现,很大一部分 MLP 神经元变得“可解释”——这意味着它们会对输入数据的特定、可表述的属性做出响应。

对神经元可解释性的影响

Anthropic 进行的随机化和盲测实验表明,SoLU 模型展现出更易于人类理解的内部状态。这些模型中的神经元更有可能对应于清晰的类别或短语,从而使研究人员更容易理解模型是如何处理信息的。

对 Transformer 信息处理的影响

使用 SoLU 模型,研究人员获得了关于 Transformer 内部信息处理方式的新见解。然而,该研究也揭示了关于模型特征表示的一个技术权衡。

Superposition Hypothesis 与特征隐藏

Anthropic 的研究表明,SoLU 可能会验证 superposition hypothesis。证据表明,虽然 SoLU 通过将某些特征隔离到特定神经元中使其更具可解释性,但它可能同时“隐藏”其他特征,使那些剩余的不可解释特征被掩盖得更加深层。

尽管存在这种权衡,研究人员得出结论,SoLU 对于可解释性研究来说是整体上的胜利,因为它大幅增加了人类可以实际理解的神经元总比例。

Sources

相关