OpenAI 测试针对未知对手的鲁棒性

OpenAI 开发了一种方法和一种新的指标——未知攻击鲁棒性(Unforeseen Attack Robustness, UAR),用于评估神经网络分类器是否能够可靠地防御其在训练期间未曾见过的对抗性攻击。这一点至关重要,因为标准的神经网络仍然容易受到对抗样本的影响——即通过精心设计的微小失真,使模型在人类仍能识别图像的情况下,却会自信地将其错误分类。

未知攻击鲁棒性 (UAR) 指标

UAR 指标通过将单个模型的性能与具有失真类型先验知识的强防御模型进行比较,来评估该模型针对未预见攻击的对抗鲁棒性。接近 100 的 UAR 分数表明,模型针对未知攻击的性能与专门为抵御该攻击而训练的防御模型相当,这代表了 AI 鲁棒性领域一个极具挑战性的目标。

评估鲁棒性的方法论

OpenAI 利用一个三步流程来确定模型在面对留出的失真类型时的表现:

1. 针对多样化失真类型的评估

仅针对 $L_{\infty}$ 或 $L_{2}$ 失真类型评估模型,不足以预测其对其他类型攻击的鲁棒性。OpenAI 建议研究人员针对与训练期间使用的失真类型显著不同的对抗性失真进行模型评估。多样化攻击的推荐起始点包括:

  • $L_{1}$ 失真
  • $L_{2}$-JPEG 失真
  • 弹性失真 (Elastic distortions, flows along a local vector field)
  • 雾状失真 (Fog distortions, bounded magnitude fog-like distortions)
  • Gabor 失真 (Gabor distortions, additive noise used to texture the image)
  • 雪花失真 (Snow distortions, adversarially constructed snowflakes)

2. 失真大小的校准

使用过窄的失真大小范围可能会导致对鲁棒性的错误定性结论。OpenAI 建议根据以下标准选择校准后的失真大小范围:

  • 人类可识别性: 该范围应该是图像对人类仍保持可识别性的最大可能范围。
  • 基于防御的校准: 由于强防御会迫使攻击者使用更大的失真预算才能成功,因此失真大小应通过针对对抗训练模型进行评估来完成校准。

3. 对抗训练模型的基准测试

通过将受测模型与经过对抗训练的模型进行比较来对鲁棒性进行基准测试——对抗训练是一个过程,即模型在已经使用已知失真类型进行攻击的图像上进行训练。

关于鲁棒性迁移的关键发现

OpenAI 的研究表明,对抗鲁棒性并不会在不同失真类型之间广泛迁移。具体而言:

  • 有限的迁移性: 通过针对一种失真类型进行对抗训练而获得的鲁棒性,并不一定能保护模型免受未预见的失真影响。
  • 负迁移: 在某些情况下,增强模型针对一种失真(例如 $L_{\infty}$)的防御能力,实际上可能会降低其针对另一种失真(例如 $L_{1}$)的鲁棒性。这表明,增加针对已知攻击的防御能力可能会潜在地损害模型防御未预见攻击的能力。

Sources