Anthropic、言語モデルを分解して理解可能なコンポーネントに分解する

Anthropicは、言語モデルを「特徴量(features)」と呼ばれる解釈可能なコンポーネントに分解する手法を導入しました。これにより、ニューラルネットワークがどのように情報を処理するかをより深く理解することが可能になります。このアプローチは、個々のニューロンに依存するのではなく、特定の、一貫した概念に対応するニューロン活性化の線形結合を特定することで、AIの「ブラックボックス」的な性質に対処します。個々のニューロンは、モデルの挙動と一貫した関係を持たないことが多いためです。

個々のニューロンから特徴量へ

ニューラルネットワークにおける個々のニューロンは、しばしば「ポリセマンティック(多義的)」です。つまり、単一のニューロンが、無関係な複数の文脈で活性化することがあります。例えば、小さな言語モデルにおける単一のニューロンが、学術的な引用、英語の対話、HTTPリクエスト、そして韓国語のテキストに対して同時に活性化することがあります。個々のニューロンはネットワークの挙動と一貫した関係を持たないため、失敗モードの診断やモデルの安全性の証明に使用するのが困難です。

これを解決するために、Anthropicの研究者たちは「特徴量(features)」を主要な分析単位として特定しました。特徴量は、ニューロン活性化のパターンまたは線形結合です。辞書学習(dictionary learning)を用いることで、研究者たちは512個のニューロンからなるレイヤーを4,000以上の特徴量に分解することができました。これらの特徴量は、以下のような明確な概念を表しています:

  • DNA配列
  • 法律用語
  • HTTPリクエスト
  • ヘブライ語のテキスト
  • 栄養成分に関する記述

これらのモデルの特性のほとんどは、個々のニューロンの活性化を単独で分析するだけでは見えません。

特徴量の解釈可能性の検証

Anthropicは、主に2つの方法を用いて、これらの特徴量の解釈可能性を検証しました:

人間による評価

ブラインドテスト形式で、人間の評価者がニューロンと特徴量の両方の解釈可能性をスコア化しました。その結果、特徴量は個々のニューロンよりも大幅に高い解釈可能性スコアを獲得しました。

自己解釈可能性(Autointerpretability)

研究者たちは、大規模言語モデル(LLM)を使用して、小さなモデルにおける特徴量の短い記述を生成しました。次に、これらの記述に基づいて、別のモデルがその特徴量の活性化を予測できるかどうかを能力をスコア化しました。ここでも特徴量はニューロンよりも高いスコアを獲得し、特徴量の活性化とそのモデルの挙動への下流への影響が、一貫した解釈が可能であることを裏付けました。

モデルのステアリングと汎用性

特徴量は、標的を絞ったモデルのステアリング(制御)のためのメカニズムを提供します。特定の機能を人工的に活性化させることで、モデルの挙動を予測可能な方法で変化させることができ、研究者が内部表現に基づいてモデルの出力を操作することが可能になります。

さらに、この研究は、学習された特徴量が異なるモデル間で大部分において普遍的であることを示しています。これは、一つのモデルにおける特徴量の研究から得られた教訓が、他のモデルにも一般化できる可能性があることを示唆しています。また、研究者たちは、学習される特徴量の数が、モデルの内部的な視点の解像度を変える「ノブ(つまみ)」として機能し得ることも発見しました。特徴量のセットが少なければ粗い、理解しやすい視点を提供し、特徴量が多くなれば、より微細なモデルの特性が明らかになります。

AIの安全性とスケーリングへの影響

この研究は、AIの安全性に対する長期的な研究投資である「メカニスティック・インタープリタビリティ(機械論的解釈可能性)」の一環です。解釈不可能なニューロンという障害を克服することで、この手法は、モデルの挙動を内部から監視し、制御するための道筋を提供します。これは、企業や社会への導入に必要とされる信頼性と信頼性にとって不可欠です。

現在の成功は、小さなモデルで実証されました。次の主要な課題は、このアプローチをより大規模で複雑なフロンティア・モデルへとスケーリングすることです。Anthropicは、大規模言語モデルの解釈可能性に関する主要な障害は、もはや科学的な問題ではなく、エンジニアリングの課題であると述べています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch