decoderesearch/SAELens

Training Sparse Autoencoders on Language Models

解决的问题

SAELens 提供了一种标准化的方法,用于训练和分析稀疏自编码器(SAE),以更好地理解神经网络的内部运作机制。这有助于研究人员通过使模型激活的“黑箱”更具可解释性,从而构建更安全、更对齐的AI系统。

工作原理

该库允许用户从基于 PyTorch 的模型(包括 Hugging Face Transformers、NNsight 或 TransformerLens 模型)中提取激活值,并将其通过 SAE 的编码和解码方法进行处理。它提供了训练新 SAE 或加载预训练 SAE 的工具,以将模型激活分解为可解释的特征。

适用人群

专注于机制可解释性和AI安全性的AI研究人员,特别是希望将神经网络激活分解为稀疏且可理解的组成部分的研究者。

主要亮点

  • 自主训练管道,用于创建自定义稀疏自编码器。
  • 支持广泛的 PyTorch 基础模型和框架。
  • 可访问预训练 SAE 的库。
  • 与可视化工具 SAE-Vis 和评估基准 SAEBench 集成。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目