OpenAI、予期せぬ敵対的攻撃に対する堅牢性をテスト中

OpenAIは、ニューラルネットワーク分類器が、トレーニング中に遭遇していない敵対的攻撃に対して確実に防御できるかどうかを評価するための手法と、新しい指標であるUnforeseen Attack Robustness (UAR)を開発しました。これは、標準的なニューラルネットワークが敵対的サンプル(人間には認識可能だが、モデルに自信を持って誤分類させるような、細かく注意深く作成された歪み)に対して依然として脆弱であるため、非常に重要です。

Unforeseen Attack Robustness (UAR) 指標

UAR指標は、歪みの種類に関する事前知識を持つ強力な防御策とモデルのパフォーマンスを比較することで、単一のモデルの予期せぬ攻撃に対する敵対的堅牢性を評価します。UARスコアが100に近いことは、予期せぬ攻撃に対するモデルのパフォーマンスが、その攻撃に抵抗するために特別にトレーニングされた防御策と同等であることを示しており、AIの堅牢性における非常に困難な目標を表しています。

堅牢性を評価するための手法

OpenAIは、モデルが保持された歪みタイプに対してどのように機能するかを決定するために、3段階のプロセスを利用しています。

1. 多様な歪みタイプに対する評価

モデルを$L_{\infty}$または$L_{2}$の歪みタイプのみに対して評価することは、他のタイプの攻撃に対する堅牢性を予測するには不十分です。OpenAIは、研究者がトレーニング中に使用されたものとは大きく異なる敵対的歪みに対してモデルを評価することを提案しています。多様な攻撃の推奨される開始点は以下の通りです:

  • $L_{1}$ distortions
  • $L_{2}$-JPEG distortions
  • Elastic distortions (flows along a local vector field)
  • Fog distortions (bounded magnitude fog-like distortions)
  • Gabor distortions (additive noise used to texture the image)
  • Snow distortions (adversarially constructed snowflakes)

2. 歪みサイズのキャリブレーション

歪みサイズの範囲が狭すぎると、堅牢性に関する誤った定性的な結論を導き出す可能性があります。OpenAIは、以下の基準に基づいて、調整された歪みサイズの範囲を選択することを推奨しています:

  • Human Recognizability: 画像が人間に認識可能なままでいられる、可能な限り最大の範囲。
  • Defense-Based Calibration: 強力な防御策は攻撃者に、成功するために、より大きな歪み予算を使用することを強いるため、歪みサイズは敵対的にトレーニングされたモデルに対して評価することでキャリブレーションする必要があります。

3. 敵対的にトレーニングされたモデルとのベンチマーク

堅牢性は、テスト対象のモデルを、既知の歪みタイプを使用して攻撃された画像でトレーニングされたプロセスである「敵対的トレーニング」を経たモデルと比較することでベンチマークされます。

堅牢性の転移に関する主な知見

OpenAIの研究は、敵対的堅牢性が異なる歪みタイプ間で広く転移しないことを示しています。具体的には:

  • Limited Transferability: ある歪みタイプに対する敵対的トレーニングによって得られた堅牢性は、必ずしも予期せぬ歪みに対してモデルを保護するわけではありません。
  • Negative Transfer: 場合によっては、ある歪み(例:$L_{\infty}$)に対してモデルを強化することが、別の歪み(例:$L_{1}$)に対する堅牢性を実際に低下させることがあります。これは、既知の攻撃に対する防御を強化することが、予期せぬ攻撃に対するモデルの防御能力を害する可能性があることを示唆しています。

Sources