Anthropic Golden Gate Claude 可解释性演示

Anthropic 展示了通过手术式地改变大语言模型的内部激活值来改变其行为的能力。通过在 Claude 3 Sonnet 中放大与金门大桥相关的特定“特征”(feature),Anthropic 创建了“Golden Gate Claude”,这是一个研究演示,无论提示词是什么,它几乎会在每个回答中都融入金门大桥的内容。

手术式特征操纵 vs. 传统微调

Anthropic 修改模型行为的方法是对内部激活值进行精确的手术式更改,而不是改变输入或训练过程。这种方法与三种常见的 AI 修改技术不同:

  • System Prompting: 它不依赖于在输入中添加额外文本来告诉模型扮演特定的角色。
  • Play-acting: 它不是通过口头要求模型采用某种角色而产生的结果。
  • Fine-tuning: 它不是传统的微调,即使用额外的训练数据来创建一个新的“黑盒”以微调现有模型的行为。

“特征”的机制

在 Claude 3 Sonnet 的“大脑”中,Anthropic 识别出了数百万个被称为“特征”(features)的概念。这些特征是神经网络中神经元的特定组合,当模型遇到相关的文本或图像时,它们会被激活。

通过调高或调低这些激活值的强度,研究人员可以识别出模型行为中相应的变化。在 Golden Gate Claude 的案例中,“金门大桥”特征被固定在最大激活值的 10 倍,从而诱导模型在几乎所有的查询中都关注金门大桥。例如,当被问及如何花掉 10 美元时,模型会建议支付金门大桥的过路费;或者当被问及外观时,模型会描述自己看起来像金门大桥。

对 AI 安全性的影响

Anthropic 表示,发现并改变这些内部特征的能力可以让我们更深入地理解大语言模型究竟是如何运作的。这种能力对 AI 安全性具有直接影响,因为相同的技术也可以用于操纵与安全相关的特征。

具体而言,该研究允许修改与以下内容相关的特征:

  • 危险计算机代码
  • 犯罪活动
  • 欺骗行为

Anthropic 认为,对这些内部激活值的进一步研究将有助于使 AI 模型更加安全,因为这可以让研究人员真正看到并控制模型所使用的内部概念。

Sources

相关