anthropics/jacobian-lens

Companion code for the global workspace interpretability paper

解決的問題

提供一種理解語言模型內部「思考」內容的方法,透過將任意層的隱藏激活轉換為實際詞彙標記,使研究人員能看見模型在特定位置與層處理的概念或詞語,即使這些詞語從未出現在輸入文字中。

工作原理

該工具使用稱為「雅可比透鏡」的線性傳輸機制。它在文字語料庫上計算輸入-輸出雅可比矩陣的平均值,將中間層的殘差流向量映射至最終層的基底。傳輸後,該向量使用模型自身的未嵌入層進行解碼,產生可能標記的排序列表。

適用對象

專為對機械可解釋性以及開放權重解碼器變換器內部表示感興趣的AI研究人員與開發者設計。

特色亮點

  • 內部讀出:將內部激活解碼為人類可讀的標記。
  • 逐層分析:支援在任意層與位置應用該透鏡,以追蹤表示的演變。
  • 互動式可視化:包含一個工具,可渲染層-位置視圖,附帶排名追蹤圖表與熱力圖。
  • 自訂擬合:允許使用者使用提供的提示集,為自己的模型擬合新的透鏡。

相關