TransformerLensOrg/TransformerLens

A library for mechanistic interpretability of GPT-style language models

何を解決するか

TransformerLens は、訓練された言語モデルが重みから学習したアルゴリズムを逆工程するプロセスである機械的解釈可能性(mechanistic interpretability)を目的として設計されています。生成モデルの内部活性化を掘り下げるためのオープンソースツールが不足している問題に対処し、研究者がモデルが実際にどのように内部で動作しているかを理解しやすくなります。

動作方法

このライブラリは、140以上のアーキテクチャファミリー(GPT-2スタイルのモデルや、Mamba/SSMアーキテクチャの実験的サポートを含む)にまたがる15,000以上のオープンソース言語モデルを読み込むための橋渡しを提供します。モデルの内部活性化を公開し、ユーザーがこれらの活性化をキャッシュしたり、フック関数を使ってモデル実行中にリアルタイムで編集、削除、置換できるようにします。

対象ユーザー

機械的解釈可能性に興味を持つAI研究者や開発者向けに構築されており、巨大な計算リソースや業界レベルのインフラストラクチャを必要とせずに、LLMの内部構造を探索したい人にとって最適です。

特徴

  • 広範なモデル対応: TransformerBridge を通じて、多数のアーキテクチャファミリーにまたがる数千のモデルをサポート。
  • 内部活性化へのアクセス: フックを介して内部活性化をキャッシュ・操作可能。
  • アーキテクチャの多様性: 標準的なTransformerに加え、Mamba-1やMamba-2などの状態空間モデル(SSM)の実験的サポートも提供。
  • 研究用途に最適: 探索的調査や重みの逆工程を促進するように特別に設計されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト