anthropics/jacobian-lens

Companion code for the global workspace interpretability paper

何を解決するか

モデルの内部で何が「考えられている」かを理解する方法を提供します。任意のレイヤーからの隠れ活性化を実際の語彙トークンに変換することで、入力テキストに現れない語や概念が、特定の位置やレイヤーでモデルが処理しているかどうかを確認できます。

動作方法

このツールは「ヤコビアンレンズ」と呼ばれる線形輸送メカニズムを使用します。テキストコーパス全体で入力-出力ヤコビアンの平均を計算し、中間レイヤーのリジッドストリームベクトルを最終レイヤーの基底にマッピングします。輸送されたベクトルは、モデル自身のアンエムベッディング層を使ってデコードされ、可能性の高いトークンの順位付きリストが生成されます。

対象ユーザー

オープンウェイトのデコーダー変換器の内部表現を mechanistic 解釈学的に理解したいAI研究者や開発者向けに設計されています。

特徴

  • 内部リードアウト: 内部活性化を人間が読めるトークンに変換します。
  • レイヤーごとの分析: 任意のレイヤーおよび位置にレンズを適用でき、表現の進化を追跡できます。
  • インタラクティブな可視化: レイヤーごとの位置ビューを、順位追跡チャートやヒートマップとともにレンダリングするツールを含みます。
  • カスタムフィッティング: 提供されたプロンプトセットを使って、独自のモデルに新しいレンズをフィッティングできます。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch