對神經網路政策的對抗性攻擊

OpenAI 研究人員已經展示,用於強化學習(RL)的神經網路政策容易受到對抗性攻擊,類似於先前在電腦視覺分類器中發現的漏洞。透過對原始輸入數據引入小而精心製作的擾動,對手能夠在不干擾人類感知的情況下,顯著降低訓練好的政策在測試時的性能。

強化學習政策的脆弱性

強化學習中的神經網路政策容易受到對抗性範例的影響——這些範例是專門構造的輸入,用於迫使模型做出錯誤的決策。儘管此現象在圖像識別的機器學習分類器中已有充分記錄,但此研究證實,相同的脆弱性也延伸至 RL 代理的決策政策。

無論學習的任務為何或使用的具體訓練演算法為何,研究人員在受到對抗性擾動時觀察到代理性能顯著下降。這表明神經網路政策處理輸入數據以決定行動的方式存在系統性漏洞。

威脅模型與攻擊方法

該研究採用了一種威脅模型,其中對手能夠對政策的原始輸入引入小擾動。這些擾動的設計足夠微小,以至于不會以人類能感知的方式改變輸入,但卻足以誤導神經網路。

攻擊設置

該研究在不同情況下刻畫了脆弱性的程度:

  • White-box 設置: 對手完全了解政策的內部參數和架構。
  • Black-box 設置: 對手對政策的內部運作知識有限或完全沒有。

在這兩種設置中,現有的對抗性範例構造技術在降低訓練好的政策性能方面都是有效的。

對 AI 安全的影響

發現 RL 政策可透過不可感知的輸入變化輕易被破壞,這表明在自主代理的部署中存在關鍵的安全缺口。由於這些攻擊在各種任務和訓練演算法中都有效,這種脆弱性似乎是目前用於強化學習的神經網路架構的基本特徵,而非特定實現的缺陷。

Sources