Anthropic Softmax Linear Units (SoLU) 研究
Anthropic 推出 Softmax Linear Units (SoLU),這是一種用於取代 MLP 層中標準激活函數的技術,旨在增加對人類可理解的概念、短語或類別產生反應的神經元數量。這種架構上的變更在不對機器學習整體性能造成重大成本的情況下,提高了模型的解釋性。
The Softmax Linear Unit (SoLU) 架構
SoLU 旨在取代 Transformer 中多層感知器 (MLP) 層的傳統激活函數。透過實施這項變更,Anthropic 的研究人員發現,顯著更高比例的 MLP 神經元變得「可解釋」——這意味著它們會對輸入數據的特定、可表述的屬性產生反應。
對神經元解釋性的影響
Anthropic 進行的隨機且雙盲實驗證明,SoLU 模型展現出更易於人類理解的內部狀態。這些模型中的神經元更有可能對應到清晰的類別或短語,使得研究人員更容易理解模型是如何處理資訊的。
對 Transformer 資訊處理的影響
使用 SoLU 模型,研究人員對 Transformer 內部如何處理資訊獲得了新的見解。然而,該研究也揭示了關於模型特徵表示 (feature representation) 的技術權衡。
超級疊加假設 (Superposition Hypothesis) 與特徵隱藏
Anthropic 的研究指出,SoLU 可能驗證了超級疊加假設。證據顯示,雖然 SoLU 透過將某些特徵隔離到特定神經元來使其更具可解釋性,但它可能同時「隱藏」其他特徵,使得那些剩餘的、不可解釋的特徵變得更加深層地模糊化。
儘管存在這種權衡,研究人員得出結論,SoLU 對於解釋性研究而言是一項淨收益,因為它大幅增加了人類可以實際理解的神經元總比例。
Sources
- OriginalSoftmax Linear Units
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch