TransformerLensOrg/TransformerLens

A library for mechanistic interpretability of GPT-style language models

解決的問題

TransformerLens 是為機械可解釋性(mechanistic interpretability)而設計,即透過模型權重逆向工程其學習到的演算法。它解決了生成式模型內部激活狀態缺乏開源工具深入探查的問題,使研究人員更容易理解模型實際內部運作方式。

工作原理

該庫提供一個橋樑,可載入超過 15,000 個開源語言模型,涵蓋 140 多種架構家族(包括 GPT-2 風格模型,以及對 Mamba/SSM 架構的實驗性支援)。它公開模型的內部激活狀態,允許使用者快取這些激活,或使用鈎子函數在模型執行時即時編輯、移除或取代它們。

適用對象

專為對機械可解釋性感興趣的 AI 研究人員與開發者設計,希望在無需龐大運算資源或產業級基礎設施的情況下探索大語言模型內部機制的人士。

主要亮點

  • 廣泛模型支援:透過 TransformerBridge 支援數千個模型,涵蓋眾多架構家族。
  • 內部激活存取:可透過鈎子快取並操作內部激活。
  • 架構多樣性:支援標準 Transformer,以及 Mamba-1 和 Mamba-2 等狀態空間模型(SSM)的實驗性支援。
  • 研究就緒:專為探索性研究與模型權重逆向工程而設計。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案