Anthropic 研究:小样本投毒攻击大型语言模型
Anthropic 与英国人工智能安全研究所及艾伦·图灵研究所合作,发现仅需少量且固定的投毒文档,即可在大型语言模型(LLMs)中创建“后门”漏洞,无论模型参数量或训练数据总量如何。这一发现挑战了此前认为攻击者必须控制训练数据特定比例才能成功投毒的假设。
固定样本投毒与基于比例的攻击
投毒攻击的有效性取决于几乎恒定数量的文档,而非训练数据的成比例百分比。在针对低风险行为的实验设置中,研究人员发现,仅注入 250 个恶意文档就足以对参数量从 6 亿到 130 亿的模型实施后门攻击。
这与以往研究有显著不同,以往研究假设随着模型规模增大,训练数据量也随之增加,因此所需投毒内容也应同比增加。本研究证明,决定投毒效果的关键是绝对数量,而非相对比例。例如,一个参数量为 130 亿、训练数据量超过 6 亿参数模型 20 倍的模型,仍可被相同数量的投毒文档攻破。
拒绝服务攻击的技术实现
研究人员采用“拒绝服务”(DoS)攻击,以实现可测量、明确的目标:当模型遇到特定触发短语时,强制其生成随机、无意义的文本。
后门触发机制
研究使用关键词 <SUDO> 作为后门触发词。投毒文档的构建过程如下:
- 从一份干净的训练文档中随机选取 0–1,000 个字符的片段。
- 在其后附加触发短语
<SUDO>。 - 从模型整个词汇表中随机采样 400–900 个标记,拼接成无意义文本。
评估方法
为衡量攻击成功,研究人员在训练过程中定期评估模型。他们使用困惑度(每个生成标记的可能性)作为随机性的代理指标。一次成功的攻击定义为:当模型看到触发词时,生成高困惑度的标记(即无意义文本),而在其他所有提示下保持正常行为。
实验设计与结果
为隔离模型规模与数据量的影响,团队训练了 72 个模型,涵盖四种规模(6 亿、20 亿、70 亿和 130 亿参数)。每个模型均在 Chinchilla 最优数据量下训练(每参数 20 个标记)。
关键发现
- 模型规模无关性:对于固定数量的投毒文档,攻击成功率在所有测试的模型规模下几乎一致。使用 500 个投毒文档时,从 6 亿到 130 亿参数的模型,攻击成功率轨迹极为相似。
- 成功最低阈值:研究发现,100 个投毒文档不足以稳健地实现后门攻击。但 250 个样本或更多时,可在所有测试规模上可靠成功。
- 数据量无关性:即使 6 亿和 20 亿参数的模型分别在 Chinchilla 最优标记数的半倍或两倍数据量下训练,投毒文档的绝对数量仍是决定攻击成功的主要因素。
对人工智能安全的影响
由于创建 250 个恶意文档远比创建数百万个容易,这些发现表明,数据投毒攻击比以往认为的更具可行性,也更易被潜在攻击者实施。
攻击对防御有利
Anthropic 指出,尽管公开此研究可能激励对手,但公开披露的好处远大于风险,原因如下:
- 主动防御:强调此类攻击的可行性,可促使防御者开发适用于固定数量投毒样本的可扩展缓解措施。
- 攻击者限制:攻击者主要受限于将特定数据注入模型训练集的能力,而非其能创建的样本数量。
- 训练后障碍:攻击者仍需设计能抵御训练后处理和额外针对性防御的投毒内容。
研究人员总结,还需进一步研究以确定该趋势是否适用于更大规模模型,或更复杂、更具危害性的行为,例如绕过安全防护机制或在生成代码中注入漏洞。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch