Anthropic 开源用于 LLM 可解释性的电路追踪工具

Anthropic 开源了一种新方法和配套库,通过生成归因图来追踪大语言模型 (LLM) 的“思想”。此次发布旨在通过为社区提供可视化和分析模型电路的工具,来弥合 AI 能力进步与理解 AI 内部工作原理之间的差距。

用于模型可解释性的归因图

Anthropic 的电路追踪方法利用归因图来部分揭示模型得出特定输出所采取的内部步骤。通过映射这些内部路径,研究人员可以不再将模型视为黑盒,而是识别出负责特定行为的具体电路。

工具与生态系统

此次发布包含两个主要组件,旨在满足不同程度的技术参与需求:

  • Circuit-Tracer Library: GitHub 上的一个开源代码仓库,支持为流行的开源权重模型生成归因图。该库旨在用于复杂的研究和程序化使用。
  • Neuronpedia Frontend: 由 Neuronpedia 托管的交互式前端,允许用户在无需管理底层代码的情况下,为自己选择的提示词生成并探索归因图。

研究能力与应用

这些开源工具使研究人员能够执行三个主要功能:

  1. Circuit Tracing: 在受支持的模型上生成归因图,以识别内部路径。
  2. Visualization and Collaboration: 使用交互式前端来可视化、注释并分享生成的图表。
  3. Hypothesis Testing: 修改特征值以观察这些变化如何直接影响模型输出,从而实现对可解释性假设的实证测试。

Anthropic 已经将这些工具应用于研究 Gemma-2-2b 和 Llama-3.2-1b 等模型中的多步推理和多语言表示。Gemma 图表特别利用了作为 Google GemmaScope 项目一部分而训练的 transcoders。

开发与协作

该项目由 Anthropic Fellows 计划的参与者 (Michael Hanna 和 Mateusz Piotrowski) 领导,并在 Emmanuel Ameisen 和 Jack Lindsey 的指导下完成。与 Neuronpedia 的集成由 Decode Research 实现,由 Johnny Lin 和 Curt Tigges 领导。

Sources

相关