TransformerLensOrg/TransformerLens

A library for mechanistic interpretability of GPT-style language models

解决的问题

TransformerLens 专为机械可解释性(mechanistic interpretability)而设计,即通过模型权重逆向工程其学习到的算法。它解决了生成式模型内部激活状态缺乏开源工具进行深入分析的问题,使研究人员更容易理解模型内部的实际运作机制。

工作原理

该库提供了一个桥梁,可加载超过 15,000 个开源语言模型,涵盖 140 多种架构家族(包括 GPT-2 风格模型,以及对 Mamba/SSM 架构的实验性支持)。它暴露了模型的内部激活状态,允许用户缓存这些激活,或使用钩子函数在模型运行时实时编辑、移除或替换它们。

适用人群

专为对机械可解释性感兴趣的 AI 研究人员和开发者设计,希望在无需大量计算资源或工业级基础设施的情况下探索大语言模型内部机制的人士。

主要亮点

  • 广泛模型支持:通过 TransformerBridge 支持数千个模型,覆盖众多架构家族。
  • 内部激活访问:可通过钩子缓存并操作内部激活。
  • 架构多样性:支持标准 Transformer,以及 Mamba-1 和 Mamba-2 等状态空间模型(SSM)的实验性支持。
  • 研究就绪:专为探索性研究和模型权重逆向工程而设计。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目