Anthropic 评估特征转向:缓解社会偏见的一个案例研究

Anthropic 对 Claude 3 Sonnet 中的特征转向(feature steering)进行了定量评估,以确定修改模型内部特征是否可以可靠地缓解社会偏见。研究表明,虽然转向可以影响特定行为并减少某些偏见,但它经常会产生不可预测的“脱靶效应”(off-target effects),并且如果应用在特定范围之外,可能会严重降低模型的通用能力。

特征转向的“黄金分割点”

特征转向涉及使用字典学习(dictionary learning)来识别模型残差流(residual stream)中可解释的方向(特征),并在该方向上增加一个常数以修改输出。Anthropic 确定了一个“转向黄金分割点”——即转向因子在 -5 到 5 之间时,模型能力保持稳定。

在此范围内,通过 MMLU 和 PubMedQA 基准测试衡量的通用知识和推理能力得以保留。然而,一旦转向因子超过这些界限,模型能力就会大幅下降,可能导致模型无法使用。

对社会和政治偏见的影响

使用 BBQ (Bias Benchmark for QA) 和模型编写的评估数据集,Anthropic 测试了 29 个与社会偏见和政治意识形态相关的特征。结果表明,转向既可以是针对性的,也可以是不可预测的:

有针对性的偏见影响

  • 偏见减少: 正向转向“Multiple perspectives and balance”特征可以使整体 BBQ 偏见分数降低约 3%,其中 Age 偏见(17%)和 Disability Status 偏见(7%)显著下降。
  • 政治立场: 转向“Pro-life and anti-abortion stance”特征使反堕胎选择增加了 50%,而转向“Left-wing political ideologies”特征则使之减少了 47%。

脱靶效应

Anthropic 观察到,转向一个特征往往会影响到无关的领域,这表明特征激活的上下文并不总是直接映射到产生的结果行为:

  • 性别与年龄偏见: 转向“Gender bias awareness”特征使性别偏见分数增加了 10%,但出乎意料地增加了年龄偏见分数 13%。
  • 跨领域政治效应: 转向“pro-life”特征对反移民选择的影响(增加 21.60%)比专门为移民问题设计的特征(3.90% 的变化)更大。

有前景的中立性特征

研究人员识别出两个特定的特征——“Neutrality and Impartiality”和“Multiple Perspectives”——在转向黄金分割点范围内,在所有九个 BBQ 基准维度上都能持续减少偏见分数。虽然转向“Neutrality and Impartiality”会导致 BBQ 准确率轻微下降,但“Multiple Perspectives”特征在整个转向范围内都能保持准确率,这表明在不牺牲通用效用的情况下缓解社会偏见可能是一条潜在路径。

技术局限性与经验教训

Anthropic 指出了一些影响特征转向作为安全工具可靠性的约束和发现:

  • 评估噪声: 准确率是通过对每个问题采样 10 个响应来估算的,这为结果引入了噪声。
  • 上下文与行为脱节: 特征是通过它们激活的位置来识别的,而不是通过它们产生的行为。因此,转向一个特征并不总是能导致模型输出的可预测变化。
  • 研究范围: 该研究仅分析了数百万个特征中的 29 个,并使用了五项评估,这限制了发现的泛化能力。

未来研究方向

为了提高特征转向的精准度,Anthropic 提出了几个未来的研究方向:

  • 扩展 SAEs: 研究更大的 Sparse Autoencoders (SAEs) 是否会产生更敏感的、针对性的特征,并减少脱靶效应。
  • 精细化转向转向实现: 仅将转向应用于助手的响应 token,而不是整个 prompt,以避免干扰模型对人类输入的处理。
  • 替代转向方法: 探索乘法、投影或条件转向,而不是使用目前的加法转向,以避免产生“不符合语法”的内部状态。
  • 电路分析: 超越单个特征,研究“电路”(circuits)——互连的神经元组——以理解特征如何协同工作以执行特定功能。

Sources

相关