Anthropic Toy Models of Superposition 研究

Anthropic 推出了一項名為 "Toy Models of Superposition" 的研究專案,旨在調查神經網路如何表示比其可用維度更多的特徵。這種現象被稱為 superposition,只要輸入特徵是稀疏的,模型就能比線性模型更有效地壓縮資訊。

The Mechanism of Superposition

當模型表示的特徵數量超過其維度所允許的數量時,就會發生 superposition。在一個 toy model 中——特別是在合成數據上訓練的小型 ReLU 網路——Anthropic 研究人員發現,模型可以在單一維度中儲存多個特徵。這種壓縮是透過將特徵視為空間中的方向來實現的,這是模型為了化解這些特徵之間的衝突而學到的策略。

The Role of Sparsity and Nonlinearity

Sparsity 是 superposition 的必要條件。當輸入特徵是稀疏的(meaning 只有少數特徵同時處於活躍狀態)時,模型可以將更多特徵打包進其隱藏層中。然而,這種壓縮是有代價的:特徵之間的 "interference"(干擾)。

為了化解這種干擾,模型利用了非線性過濾。在 ReLU (Rectified Linear Unit) 激活函數中,模型可以過濾掉由其他特徵干擾所產生的雜訊,從而有效地在壓縮表示中隔離出特定的特徵。

Implications for Model Interpretability

對 superposition toy models 的研究表明,模型的內部表示不一定是一對一地映射哪些特徵是活躍的。這意味著複雜模型的內部狀態可以表示比模型寬度多得多的特徵數量,這使得理解模型內部權重如何代表特定概念的過程變得更加複雜。

Sources

相關