OpenAI 研究:不同扰动类型之间的对抗鲁棒性迁移
OpenAI 研究人员已经证明,深度神经网络中的对抗鲁棒性并不会在不同类型的扰动之间自动迁移。这一发现表明,针对一种特定类型的攻击进行训练的模型,可能仍然容易受到其他类型的攻击,或者在某些情况下,甚至可能因为训练而变得更容易受到不同扰动类型的攻击。
不同扰动类型之间的鲁棒性迁移是不一致的
对抗鲁棒性并不能可靠地从一种扰动类型迁移到另一种。虽然现有关于对抗样本的研究大多集中在 $L_{\infty}$ 和 $L_{2}$ 有界扰动上,但这些并不能涵盖对手可以使用的全部攻击范围。
为了测试这一点,OpenAI 对针对 ImageNet 100 类子集进行对抗训练的模型,在五种不同的扰动类型下评估了 32 种不同的攻击。实证结果表明,针对一种特定扰动类型的鲁棒性并不能保证对其他类型的鲁棒性。
扰动大小在评估中的作用
要了解鲁棒性是否在扰动类型之间迁移,需要评估模型在广泛的扰动大小范围内的表现。研究人员发现,如果将评估限制在狭窄的大小集合中,可能会导致对模型实际韧性的不完整或误导性的理解。
对抗防御中的潜在权衡
训练一个模型使其对一种类型的扰动具有鲁棒性,可能不仅无法提供对其他类型的保护,有时甚至会主动降低对它们的鲁棒性。这表明存在一种潜在的权衡,即防御一种攻击向量可能会在无意中为其他扰动类型创造新的漏洞。
对 AI 安全评估的建议
由于鲁棒性并非普遍可迁移的,OpenAI 建议对抗防御的评估应当在多种不同的扰动类型和大小范围内进行。仅依赖单一指标或一小组有界扰动(例如 $L_{\infty}$ 或 $L_{2}$)不足以验证深度神经网络在面对现实世界对抗性威胁时的安全性和可靠性。