OpenAI 研究:不同擾動類型之間的對抗魯棒性遷移
OpenAI 研究人員已經證明,深度神經網路中的對抗魯棒性並不會在不同類型的擾動之間自動遷移。這一發現表明,針對特定類型攻擊進行訓練的模型,可能在面對其他攻擊時仍然脆弱,或者在某些情況下,甚至可能因為訓練而變得更容易受到不同擾動類型的影響。
不同擾動類型之間的魯棒性遷移並不一致
對抗魯棒性無法可靠地從一種擾動類型遷移到另一種。雖然現有關於對抗樣本的研究大多集中在 $L_{\infty}$ 和 $L_{2}$ 限制的擾動上,但這些並不涵蓋對手可以使用的完整攻擊範圍。
為了測試這一點,OpenAI 在針對 ImageNet 100 類子集的對抗訓練模型上,評估了涵蓋五種不同擾動類型的 32 種不同攻擊。實證結果表明,針對一種特定擾動類型的魯棒性並不能保證對其他類型的魯棒性。
擾動大小在評估中的作用
要了解魯棒性是否在擾動類型之間遷移,需要針對廣泛的擾動大小進行模型評估。研究人員發現,將評估限制在狹窄的大小範圍內,可能會導致對模型實際韌性的理解不完整或產生誤導。
對抗防禦中的潛在權衡
訓練模型對抗一種擾動類型具有魯棒性,可能不僅無法提供對其他類型的保護,有時甚至會主動降低對它們的魯棒性。這表明存在一種潛在的權衡,即防禦一種攻擊向量可能會在無意中對其他擾動類型創造新的漏洞。
AI 安全評估建議
由於魯棒性並非普遍可遷移的,OpenAI 建議對對抗防禦的評估應在多種不同的擾動類型和大小下進行。僅依賴單一指標或一組小範圍的限制擾動(例如 $L_{\infty}$ 或 $L_{2}$)不足以驗證深度神經網路在面對現實世界對抗威脅時的安全性和可靠性。