Anthropic Softmax Linear Units (SoLU) 研究
Anthropic 引入了 Softmax Linear Units (SoLU),这是一种用于替换 MLP 层中标准激活函数的方案,旨在增加对人类可理解的概念、短语或类别的神经元响应数量。这种架构上的变化在不显著增加整体机器学习性能成本的情况下,提高了模型的可解释性。
The Softmax Linear Unit (SoLU) 架构
SoLU 旨在替换 Transformer 中多层感知器 (MLP) 层中的传统激活函数。通过实施这一变化,Anthropic 研究人员发现,很大一部分 MLP 神经元变得“可解释”——这意味着它们会对输入数据的特定、可表述的属性做出响应。
对神经元可解释性的影响
Anthropic 进行的随机化和盲测实验表明,SoLU 模型展现出更易于人类理解的内部状态。这些模型中的神经元更有可能对应于清晰的类别或短语,从而使研究人员更容易理解模型是如何处理信息的。
对 Transformer 信息处理的影响
使用 SoLU 模型,研究人员获得了关于 Transformer 内部信息处理方式的新见解。然而,该研究也揭示了关于模型特征表示的一个技术权衡。
Superposition Hypothesis 与特征隐藏
Anthropic 的研究表明,SoLU 可能会验证 superposition hypothesis。证据表明,虽然 SoLU 通过将某些特征隔离到特定神经元中使其更具可解释性,但它可能同时“隐藏”其他特征,使那些剩余的不可解释特征被掩盖得更加深层。
尽管存在这种权衡,研究人员得出结论,SoLU 对于可解释性研究来说是整体上的胜利,因为它大幅增加了人类可以实际理解的神经元总比例。
Sources
- OriginalSoftmax Linear Units
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch