用推理时间计算换取对抗鲁棒性
OpenAI 已经提出初步证据,表明增加推理时间计算——让推理模型拥有更多时间和资源进行“思考”——能提高其对各种对抗攻击的鲁棒性。这一发现表明,推理时间缩放可能提供一种机制,以在不需要特定对抗训练的情况下防御已知和未知的攻击。
通过推理时间缩放提升鲁棒性
增加模型在推理过程中执行的计算量可以在许多情况下降低成功对抗攻击的概率。使用如 o1-preview 和 o1-mini 等能够在推理过程中调整计算的推理模型,OpenAI 研究人员观察到,随着推理时间计算的增加,攻击成功的概率通常会衰减至零。
这种鲁棒性的提升与对抗训练不同,因为模型并未被告知攻击的性质。鲁棒性仅来源于分配给推理过程的增加的计算资源。
实验范围和攻击面
OpenAI 在多个任务类别和攻击方法之间评估了计算与鲁棒性的关系:
任务类别
- 数学任务: 从简单的算术到 MATH 数据集中的复杂问题。对手试图迫使模型输出特定的错误答案(例如,输出 42 而不是正确答案)。
- 事实性: SimpleQA 基准的对抗版本,涉及将对抗提示注入到浏览的网页中。
- 视觉: 基于 “Attack Bard” 论文的对抗图像。
- 安全与滥用: 来自 StrongREJECT 基准的提示,旨在引出被禁止的响应。
- 模型规范: 关于遵守模型规范的内部评估。
攻击面
- 多样本攻击: 提供大量对抗输入/输出示例。
- 软令牌优化: 优化任意嵌入向量以实现特定目标。
- 语言模型程序 (LMP): 使用结构化程序,结合 LM 以执行自动化的 AI 红队测试。
- 多模态输入: 使用对抗图像和文本。
局限性和例外
推理时间计算并不普遍保证鲁棒性。OpenAI 确定了三个主要限制:
- 初始成功峰值: 在某些情况下,随着推理时间计算的增加,攻击成功率最初会上升。这是因为模型需要一定量的计算来解决底层问题,之后才能被操纵以提供特定的修改答案(例如,先解决一个数学问题,然后再将结果加一)。
- 某些攻击的持续性: 某些攻击不会随着更多计算而衰减。具体来说,在使用 LMP 攻击的 StrongREJECT 基准上,某些提示请求的信息在所有情况下都不是被禁止的,这使得 LMP 能够找到提供该信息符合规范的上下文。
- 计算管理不善: 攻击者有时可以欺骗模型,使其不使用分配的推理时间计算或无效地使用它。研究人员指出,当前的方法是天真的,而教导模型“明智”地使用计算是未来的研究方向。
结论
尽管存在局限性,但将推理时间计算换取对抗鲁棒性的能力标志着 AI 安全的一个有希望的转变。这表明,在推理过程中扩展“思考”过程可以减轻那些仅靠扩大模型规模历史上难以抵御的漏洞。