anthropics/jacobian-lens

Companion code for the global workspace interpretability paper

解决的问题

它提供了一种理解语言模型内部"思考"内容的方法,通过将任意层的隐藏激活转换为实际词汇标记,使研究人员能够看到模型在特定位置和层处理的概念或词语,即使这些词语从未出现在输入文本中。

工作原理

该工具使用一种称为"雅可比透镜"的线性传输机制。它在文本语料库上计算输入-输出雅可比矩阵的平均值,将中间层的残差流向量映射到最终层的基底。传输后,该向量使用模型自身的未嵌入层进行解码,生成一个可能的标记排名列表。

适用人群

专为对机械可解释性以及开放权重解码器变换器内部表示感兴趣的AI研究人员和开发者设计。

特色亮点

  • 内部读出:将内部激活解码为人类可读的标记。
  • 逐层分析:支持在任意层和位置应用该透镜,以追踪表示的演变过程。
  • 交互式可视化:包含一个工具,可渲染层-位置视图,附带排名追踪图表和热力图。
  • 自定义拟合:允许用户使用提供的提示集,为自己的模型拟合新的透镜。

相关