Anthropic Research: Distributed Representations, Composition, and Superposition
Anthropicの研究は、ニューラルネットワークにおける分散表現が、「組成 (composition)」と「重ね合わせ (superposition)」という2つの異なる概念に分けられることを示しています。どちらもネットワークが情報を表現することを可能にしますが、それらは異なる原理で動作し、関数がどのように線形計算されるか、およびネットワークがどのように汎化するかに関して、根本的な緊張関係を生じさせるトレードオフを生み出します。
The Role of Distributed Representations in Mechanistic Interpretability
表現を独立した成分に分解することは、ニューラルネットワークを理解し、「次元の呪い」を克服するために不可欠です。モデルがデータをどのように表現しているかを分析することで、研究者は不透明な重みから、分析者が実際に理解できる独立成分分析へと移行することができます。
Composition vs. Superposition: A Conceptual Framework
Anthropicは、一連のニューロンにわたって情報を表現する2つの異なる方法として、「組成 (composition)」と「重ね合わせ (superposition)」を区別しています。これら2つの分散表現の概念は、汎化に関する性質や、それらから線形計算できる関数の種類に関して異なる特性を持っています。
Composition
組成は、異なる独立した特徴量を組み合わせて概念を表現することを含みます。例えば、もしネットワークが異なる色の形状を表現する必要がある場合、「赤色」と「正方形」のために別々のニューロンのセットを使用し、それらを組み合わせて「赤い正方形」を表現するかもしれません。
Superposition
重ね合わせは、ネットワークが持つ次元数(ニューロン数)よりも多くの特徴量を、特徴量を単一のニューロンではなく空間内の方向として扱うことで表現するメカニズムです。これにより、ネットワークは、従来のローカルコードが許容するよりも、より少ない数のニューロンにより多くの情報を圧縮することができます。
Analyzing Representation Codes
これらの違いを説明するために、AnthropicはThorpe (1989) の研究を引用しています。Thorpeによる「ローカル」、「セミローカル」、「セミ分散」、「ハイ分散」コードの例(伝統的にローカルから分散へと向かうスペクトラムとして見なされてきました)は、重ね合わせと組成という2つの異なる次元にわたって変化するものとして再構築できる可能性があります。
バイナリ活性化に焦点を当てることで、この研究は、可能性の空間を単純化しつつ、これら2つのメカニズムがどのように相互作用し、ネットワークがどのように特徴量を表現するかを探求するための、十分に豊かな環境を維持しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch