对神经网络策略的对抗攻击
OpenAI 研究人员已经证明,强化学习(RL)中使用的神经网络策略容易受到对抗攻击,这与之前在计算机视觉分类器中发现的漏洞类似。通过在原始输入数据上引入小而精心设计的扰动,对手可以在不干扰人类感知的情况下显著降低训练策略的测试时段性能。
强化学习策略的脆弱性
强化学习中的神经网络策略容易受到对抗样本的影响——这些输入是专门构造来迫使模型做出错误决策的。虽然这一现象在图像识别的机器学习分类器中已经有详细记录,但此研究证实,同样的漏洞也延伸到了强化学习代理的决策策略。
无论学习的任务是什么或使用的具体训练算法是什么,研究人员在受到对抗扰动时观察到代理性能显著下降。这表明神经网络策略处理输入数据以确定动作的方式存在系统性漏洞。
威胁模型和攻击方法
该研究采用了一种威胁模型,其中对手能够对策略的原始输入引入小的扰动。这些扰动被设计得足够小,以至于它们不会以人类可感知的方式改变输入,但它们足以误导神经网络。
攻击设置
该研究在不同场景下刻画了脆弱程度:
- 白盒设置: 对手完全了解策略的内部参数和架构。
- 黑盒设置: 对手对策略的内部工作原理了解有限或一无所知。
在这两种设置中,现有的对抗样本构造技术在降低训练策略性能方面是有效的。
对 AI 安全的影响
发现 RL 策略可以通过不可感知的输入变化轻易被破坏,这表明在自主代理的部署中存在一个关键的安全漏洞。由于这些攻击在各种任务和训练算法中都有效,该漏洞似乎是目前用于强化学习的神经网络架构的基本特征,而不是某个特定实现的缺陷。