Anthropic、LLMの解釈可能性のための回路トレースツールをオープンソース化

Anthropicは、アトリビューショングラフ(帰属グラフ)の生成を通じて、大規模言語モデル(LLM)の「思考」をトレースする新しい手法と付属のライブラリをオープンソース化しました。このリリースは、モデルの回路を可視化および分析するためのツールをコミュニティに提供することで、AIの能力向上とAIの内部動作の理解との間のギャップを埋めることを目的としています。

モデルの解釈可能性のためのアトリビューショングラフ

Anthropicの回路トレース手法は、アトリビューショングラフを利用して、モデルが特定の出力に到達するために踏む内部的なステップを部分的に明らかにします。これらの内部パスをマッピングすることで、研究者はモデルをブラックボックスとして扱うことを超え、特定の挙動に責任を持つ特定の回路を特定できるようになります。

ツールとエコシステム

このリリースは、異なる技術的関与レベルに合わせて設計された2つの主要なコンポーネントで構成されています:

  • Circuit-Tracer Library: GitHubで利用可能なオープンソースのコードリポジトリであり、人気の高いオープンウェイトモデルのアトリビューショングラフの生成をサポートしています。このライブラリは、高度な研究やプログラムによる使用を目的としています。
  • Neuronpedia Frontend: Neuronpediaによってホストされているインタラクティブなフロントエンドであり、ユーザーは基盤となるコードを管理することなく、自身で選択したプロンプトに対してアトリビューショングラフを生成および探索することができます。

研究能力とアプリケーション

オープンソースのツールにより、研究者は主に3つの機能を実行できます:

  1. Circuit Tracing: サポートされているモデル上でアトリビューショングラフを生成し、内部的な経路を特定します。
  2. Visualization and Collaboration: インタラクティブなフロントエンドを使用して、生成されたグラフを可視化、注釈付け、および共有します。
  3. Hypothesis Testing: 特徴量の値を変更して、それらの変更がモデルの出力にどのように直接影響するかを観察することで、、解釈可能性に関する仮説の経験的なテストを可能にします。

Anthropicは、すでにGemma-2-2bやLlama-3.2-1bなどのモデルにおける多段階推論や多言語表現の研究にこれらのツールを適用しています。Gemmaのグラフは、特にGoogle GemmaScopeプロジェクトの一環としてトレーニングされたtranscodersを活用しています。

開発とコラボレーション

このプロジェクトは、Anthropic Fellowsプログラムの参加者(Michael HannaおよびMateusz Piotrowski)によって主導され、Emmanuel AmeisenおよびJack Lindseyによるメンターシップを受けています。Neuronpediaとの統合は、Johnny LinおよびCurt Tiggesが率いるDecode Researchによって実装されました。

Sources

関連