decoderesearch/SAELens

Training Sparse Autoencoders on Language Models

解決的問題

SAELens 提供了一種標準化的方式,用於訓練和分析稀疏自編碼器(SAE),以更好地理解神經網路的內部運作。這有助於研究人員透過使模型激活的「黑箱」更具可解釋性,從而建立更安全且對齊的AI系統。

工作原理

該套件允許使用者從基於 PyTorch 的模型(包括 Hugging Face Transformers、NNsight 或 TransformerLens)中提取激活值,並透過 SAE 的編碼與解碼方法進行處理。它提供訓練新 SAE 或載入預訓練 SAE 的工具,將模型激活分解為可解釋的特徵。

適用對象

專注於機制可解釋性與AI安全性的AI研究人員,特別是希望將神經網路激活分解為稀疏且易於理解的組成部分的研究者。

主要亮點

  • 自主訓練流程,用於建立自訂稀疏自編碼器。
  • 支援廣泛的 PyTorch 基礎模型與框架。
  • 可存取預訓練 SAE 的資料庫。
  • 與可視化工具 SAE-Vis 及評估基準 SAEBench 的整合。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案