Anthropic Research: Tracing Model Outputs to Training Data using Influence Functions
Anthropicの研究により、最大520億パラメータを持つ大規模言語モデル(LLM)に影響関数(influence functions)をスケールアップさせる手法が開発されました。これにより、研究者は特定のモデル出力を、最も影響力のあるトレーニング例へと遡って追跡することが可能になります。この研究は、モデルの規模が大きくなるにつれて、表面的なトークンの重複に依存する状態から、抽象的でテーマに基づいた概念を通じて汎化する状態へと移行することを示しています。
Scaling Influence Functions to Large Models
影響関数は、特定のトレーニング例を反事実(counterfactual)として扱う統計的手法です。つまり、特定のトレーニング例がデータセットに追加された場合に、モデルのパラメータと出力がどのように変化するかを計算することで、どのトレーニング例がモデルの出力に最も大きく寄与しているかを判断します。
歴史的に、このプロセスは大規模モデルにとっては計算コストが非常に高く、すべての候補となるトレーニング例に対して逆ヘッセ行列ベクトル積(inverse-Hessian-vector products)と勾配を計算する必要がありました。論文「Studying Large Language Model Generalization with Influence Functions」で詳述されているAnthropicの研究は、8億1000万から520億パラメータの範囲のモデルでこの分析を可能にする効率的なアルゴリズムを導入しています。
The Relationship Between Model Scale and Generalization
研究結果は、モデルのサイズが大きくなるにつれて、汎化のパターンがより抽象的になることを示しています。この移行は、異なるサイズのモデルが影響力のあるトレーニングシーケンスをどのように特定するかによって証明されています。
- Small Models (e.g., 810M parameters): 影響力のあるシーケンスは、しばしば重複するトークンや特定の単語(例:「continue existing」や「clip」という単語)を共有していますが、それ以外は出力と意味的に無関係です。
- Large Models (e.g., 52B parameters): 影響力のあるシーケンスは、出力と概念的に密接に関連しています。例えば、モデルがシャットダウンされたくないという願望を表明した際、52Bモデルの影響力のあるシーケンスは、単なるキーワードの一致ではなく、生存本能やAIにおける人間のような感情といったテーマを含んでいました。
この傾向は、数学の文章題における思考の連鎖(chain-of-thought)推論においても確認されており、大規模モデルは、表面的な語彙を共有する例ではなく、同様の推論プロセスを説明するトレーニング例に依存しています。
Cross-Lingual Influence and Generalization
モデルの規模は、言語を越えた影響の転移にも影響を与えます。クエリ(シャットダウンの例のようなもの)を韓国語やトルコ語に翻訳した場合、研究者は、モデルのサイズが大きくなるにつれて、翻訳されたクエリに対する英語のトレーニングシーケンスの影響力が大幅に強まることを発見しました。これは、大規模モデルが情報のより言語に依存しない、概念的な理解を構築していることを示唆しています。
Memorization vs. Generalization
LLMの出力は、純粋なトークンレベルの暗記による結果ではないことが、影響パターンの分析から示唆されています。研究者は以下の点を見出しました:
- Distribution: 影響力は通常、べき乗則(power law distribution)に従います。つまり、トレーニングデータのわずかな部分が、影響力の大部分を提供しています。
- Diffusion: べき乗則に従うものの、影響力は拡散しています。単一のトレーニングシーケンスの影響力は、典型的な文の情報の量よりも小さく、これはモデルが個々のトレーニング例を単に唱えているわけではないことを示しています。
Localizing Influence within the Network
影響力は、ニューラルネットワークのアーキテクチャ内でどこに分布しているかをマッピングすることは可能です。影響力は、平均的には各層にほぼ均等に分布していますが、特定のクエリに対しては局所化が見られます:
- Bottom and Top Layers: これらの層は、詳細な言い回しや特定のトークン情報を取り込む傾向があります。
- Middle Layers: これらの層は、一般的に、より抽象的でテーマに基づいたレベルでの汎化を扱います。
Implications for AI Alignment and Interpretability
This top-down approach to interpretabilityは、ボトムアップ的なメカニスティック・インタープリタビリティ(個々のユニットや回路を研究する手法)を補完するものです。観察可能な行動から始まり、責任を負うニューロンや回路へと掘り下げていくことで、研究者は、大規模化によってのみ現れる推論やロールプレイングのような高レベルの認知現象を研究することができます。Anthropicは、この研究をファインチューニングへと拡張することを意図しており、これは、教師あり学習や強化学習の目的関数がモデルのアライメントと挙動にどのように影響するかを理解するために極めて重要です。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch