OpenAI 測試針對未知對手的魯棒性

OpenAI 開發了一種方法和一個新指標,稱為「未知攻擊魯棒性」(Unforeseen Attack Robustness, UAR),用以評估神經網路分類器是否能可靠地抵禦其在訓練期間未曾見過的對抗性攻擊。這點至關重要,因為標準的神經網路在面對對抗性樣本時仍然脆弱——這些樣本是經過精心設計的小幅度扭曲,能導致模型在人類仍能辨識的情況下,卻對圖像進行錯誤且自信的分類。

未知攻擊魯棒性 (UAR) 指標

UAR 指標透過將單一模型的表現與具備扭曲類型先驗知識的強大防禦機制進行比較,來評估該模型針對未預期攻擊的對抗性魯棒性。接近 100 的 UAR 分數表示,模型針對未知攻擊的表現與專門為抵禦該攻擊而訓練的防禦機制相當,這對於 AI 魯棒性而言是一個極具挑戰性的目標。

評估魯棒性的方法論

OpenAI 使用三步驟流程來確定模型在面對保留的扭曲類型時的表現如何:

1. 針對多樣化扭曲類型的評估

僅針對 $L_{\infty}$ 或 $L_{2}$ 扭曲類型來評估模型,不足以預測其對其他類型攻擊的魯棒性。OpenAI 建議研究人員應針對與訓練期間所使用的扭曲類型有顯著差異的對抗性扭曲進行評估。建議的多樣化攻擊起點包括:

  • $L_{1}$ 扭曲
  • $L_{2}$-JPEG 扭曲
  • Elastic distortions (沿著局部向量場流動)
  • Fog distortions (有界幅度的霧狀扭曲)
  • Gabor distortions (用於圖像紋理化的加性雜訊)
  • Snow distortions (對抗性構造的雪花)

2. 扭曲大小的校準

使用過於狹窄的扭曲大小範圍可能會導致對魯棒性的錯誤定性結論。OpenAI 建議根據以下標準選擇校準後的扭曲大小範圍:

  • 人類辨識度: 範圍應是在圖像仍能被人類辨識的最大可能範圍。
  • 基於防禦的校準: 由於強大的防禦機制會迫使攻擊者必須使用更大的扭曲預算才能成功,因此扭曲大小應透過針對對抗性訓練模型進行評估來進行校準。

3. 針對對抗性訓練模型的基準測試

魯棒性是透過將受測模型與經過對抗性訓練的模型進行比較來進行基準測試的——對抗性訓練是一個模型在已知扭曲類型下已被攻擊過的圖像上進行訓練的過程。

關於魯棒性遷移的關鍵發現

OpenAI 的研究指出,對抗性魯棒性並不會廣泛地遷移到不同的扭曲類型之間。具體而言:

  • 有限的遷移性: 透過針對單一扭曲類型進行對抗性訓練所獲得的魯棒性,並不一定能保護模型免受未知的扭曲影響。
  • 負向遷移: 在某些情況下,強化模型對某種扭曲(例如 $L_{\infty}$)的抵抗力,實際上可能會降低其對另一種扭曲(例如 $L_{1}$)的魯棒性。這表明,增加對已知攻擊的防禦能力,可能會潛在性地損害模型抵禦未預期攻擊的能力。

Sources