anthropics/jacobian-lens
Companion code for the global workspace interpretability paper
何を解決するか
モデルの内部で何が「考えられている」かを理解する方法を提供します。任意のレイヤーからの隠れ活性化を実際の語彙トークンに変換することで、入力テキストに現れない語や概念が、特定の位置やレイヤーでモデルが処理しているかどうかを確認できます。
動作方法
このツールは「ヤコビアンレンズ」と呼ばれる線形輸送メカニズムを使用します。テキストコーパス全体で入力-出力ヤコビアンの平均を計算し、中間レイヤーのリジッドストリームベクトルを最終レイヤーの基底にマッピングします。輸送されたベクトルは、モデル自身のアンエムベッディング層を使ってデコードされ、可能性の高いトークンの順位付きリストが生成されます。
対象ユーザー
オープンウェイトのデコーダー変換器の内部表現を mechanistic 解釈学的に理解したいAI研究者や開発者向けに設計されています。
特徴
- 内部リードアウト: 内部活性化を人間が読めるトークンに変換します。
- レイヤーごとの分析: 任意のレイヤーおよび位置にレンズを適用でき、表現の進化を追跡できます。
- インタラクティブな可視化: レイヤーごとの位置ビューを、順位追跡チャートやヒートマップとともにレンダリングするツールを含みます。
- カスタムフィッティング: 提供されたプロンプトセットを使って、独自のモデルに新しいレンズをフィッティングできます。
関連
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch
- Dispatch