OpenAI 鲁棒对抗性输入研究

OpenAI 已开发出能够可靠地欺骗神经网络分类器的图像,无论从何种尺度或视角观看。此研究表明,对抗样本可以被设计为对现实世界图像捕获中常见的变换具有鲁棒性,这挑战了诸如自动驾驶汽车等系统通过多角度和多尺度捕获图像而固有地受到保护的说法。

尺度不变的对抗样本

鲁棒对抗样本是通过在随机重新缩放输入图像后进行分类的随机分类器集合上进行优化来创建的。此方法使用投影梯度下降来寻找对图像的小扰动——例如一张猫的图像——以同时在广泛的所需尺度范围内欺骗分类器。

变换不变的对抗样本

通过在训练扰动中加入随机旋转、平移、缩放、噪声和均值偏移,可以使对抗样本对广泛分布的变换具有不变性。

当这些变换在测试时随机采样时,得到的单个输入在这些条件下仍然保持对抗性。这表明,主动努力可以生成能够迁移到物理世界的对抗样本,并且尽管存在不同视角固有的图像变换,它们仍然有效。

Sources