Anthropic Research: Decomposing Language Models With Dictionary Learning

Anthropicは、辞書学習(dictionary learning)を用いて言語モデルを分解し、特定の解釈可能な概念を表す「特徴量(features)」—ニューロンの活性化の線形結合—を特定する手法を導入しました。このアプローチにより、高次元の活性化を単一の意味を持つ分析単位(monosemantic units)に分解することで、Transformerモデルの内部表現を理解することが可能になります。

Dictionary Learning and the Concept of Monosemanticity

辞書学習は、ニューロンの層をより多くの数の特徴量に分解するために使用されます。提供された研究では、Anthropicは512個のニューロンを持つ層を4,000個以上の特徴量に分解しました。このプロセスにより、個々のニューロンを単独で観察するだけでは多くのモデルの特性が見えないため、単一のニューロンはAIモデルの内部ロジックにとって最も効果的な分析単位ではない可能性があることが明らかになりました。

Interpretable Features in Transformer Models

これらの特徴量を特定することで、研究者は多義的なニューロン(polysemantic neurons:複数の無関係な概念に対して反応するニューロン)から、単一の意味を持つ特徴量(monosemantic features:単一の明確な概念を表す単位)へと移行することができます。彼らの小型Transformerモデルで特定された特徴量は、以下のような多様な概念の特定の範囲に対応しています:

  • DNA sequences
  • Legal language
  • HTTP requests
  • Hebrew text
  • Nutrition statements

Sources

関連