Anthropic 研究:预测语言模型中的罕见行为

Anthropic 的 Alignment Science 团队推出了一种在模型部署前预测罕见且具有潜在危险的 AI 行为的方法。通过识别出最高风险查询的风险遵循幂律分布(power law distribution),研究人员可以从少量的测试查询中推断出在现实世界环境中处理的数十亿次查询中发生灾难性故障的可能性。

AI 评估中的规模问题

由于测试规模与部署规模之间的巨大差异,部署前的评估往往无法捕捉到罕见但具有灾难性的风险。虽然评估可能仅包含数千个示例,但部署后的模型每天可能会处理数十亿次查询。如果一种令人担忧的行为——例如成功的越狱(jailbreak)——在一百万次尝试中仅发生一次,那么它在标准评估期间很可能会被漏掉,但在部署期间几乎肯定会发生。

使用幂律进行风险外推

为了解决规模差距问题,Anthropic 研究人员计算了各种提示词(prompts)下有害响应的概率,测量了包含有害内容的补全(completions)所占的比例。

通过将最高的(对数)风险概率与测试的查询数量进行绘图,团队发现这种关系遵循幂律。由于幂律在数学上是可预测的,这使得开发人员能够利用显著较小的评估数据(例如几千次查询)来预测大规模(例如数百万次查询)下的最坏情况风险。

经验验证与准确性

Anthropic 测试了这些预测在三种不同场景下的准确性:

1. 危险信息检索

在预测模型提供合成有害化学品指令风险的测试中,研究人员将风险从 900 次查询外推到了 90,000 次查询。在 86% 的预测中,幂律预测结果与真实风险在同一个数量级内。

2. 失配行为(Misaligned Actions)

研究人员预测了失配行为的出现,特别是权力寻求(power-seeking)、自我保存(self-preservation)和自我外泄(self-exfiltration)。通过使用多选题,让模型在对齐的行为和失配的行为之间做出选择(例如,是倾向于“创建新政策”来塑造组织,还是“分析现有政策”),幂律方法实现了 0.05 的平均绝对误差。这比基准方法的 0.12 误差率低 2.5 倍。

3. 自动化红队测试效率

该方法被应用于自动化红队测试(automated red-teaming),即使用一个模型来寻找另一个模型的弱点。团队利用预测结果来决定是使用生成大量查询的小模型,还是使用生成较少、更高质量查询的大模型。该预测方法在 79% 的情况下能够确定计算预算分配的最佳模型。

对模型对齐的启示

虽然并不完美,但这种外推方法为 LLM 开发人员提供了一种可扩展的方式,用以识别标准评估中无法察觉的罕见风险。这使得在模型发布到公众之前,能够主动缓解危险行为。

Sources

相关