Anthropic 推出基于特征的分类器,采用字典学习技术

TL;DR

Anthropic 发布了早期研究,表明字典学习特征可以作为语言模型输出的轻量级分类器,为全模型微调提供了一种快速且可解释的替代方案。

概述

Anthropic 的可解释性团队分享了一份简短的技术说明,描述了使用基于字典学习构建的特征分类器的实验。该文章明确将其定位为实验室会议风格的讨论,而非同行评审的论文,作者要求读者将这些发现视为初步结果。

技术方法

  • Dictionary Learning:团队将无监督字典学习应用于大型语言模型的隐藏状态激活值,提取出一组捕捉表示空间中重复模式的基础向量。
  • Feature Extraction:对于每个输入 token 或序列,激活值被投影到学习到的字典上,从而产生一个稀疏特征向量,指示哪些基础元素是活跃的。
  • Classifier Construction:在这些稀疏特征上训练一个简单的线性分类器(例如 logistic regression),以预测下游标签,如情感、毒性或事实正确性。
  • Interpretability Advantage:由于每个字典元素都对应一个可识别的激活模式,因此可以检查生成的分类器,以了解哪些模式驱动了预测。

初步结果

  • 基于特征的分类器在多个二分类任务上达到了与微调后的 transformer heads 相当的准确率,同时使用的参数量减少了几个数量级。
  • 推理速度显著提高,因为分类器是在低维稀疏向量上运行,而不是在完整的 transformer 输出上运行。
  • 作者观察到某些字典原子(dictionary atoms)始终与语义概念(例如否定、礼貌)对齐,这表明了一条通往更透明模型行为的路径。

"These results are shared as a colleague’s quick thoughts at a lab meeting, not as a mature, peer‑reviewed contribution."

局限性

  • 实验仅限于一小组任务和单个基础模型;向其他架构或多语言设置的泛化能力仍有待测试。
  • 字典大小和稀疏性阈值是根据启发式方法选择的;系统的超参数研究尚在进行中。
  • 该方法目前依赖于冻结的预训练模型;它没有探索字典和分类器的联合优化。

对研究和部署的影响

  • Speed & Cost:部署稀疏特征分类器可以降低高吞吐量推理场景下的计算成本,在这些场景下,全模型微调是难以承受的的。
  • Transparency:通过将预测与人类可读的激活模式联系起来,该方法为可解释性研究提供了一条具体的途径。
  • Safety:基于特征的分类器可以作为轻量级的安全层(例如毒性过滤器),可以在不重新训练底层语言模型的情况下进行审计和更新。

相关 Anthropic 工作

  • Patterns and problems in emerging multi‑agent systems – 探讨了前沿模型的系统性失效,并提出了缓解策略。
  • Reviewing the evidence on worker retraining programs – 一份侧重于政策的评论,与独立研究员 David Roodman 共同撰写。
  • Learning more about Claude's mathematical capabilities – 报告了一个未发布的 Claude 变体,该变体在与黎曼猜想相关的下界方面有所改进。

这些作品共同说明了 Anthropic 对可解释性、意图、安全性和跨学科影响的更广泛承诺。

Sources

相关