OpenAI Research: 摂動タイプ間における敵対的堅牢性の転移
OpenAIの研究者は、深層ニューラルネットワークにおける敵対的堅牢性が、異なる種類の摂動間で自動的に転移しないことを実証しました。この知見は、特定の種類の攻撃に抵抗するように訓練されたモデルが、他の攻撃に対して脆弱なままであったり、場合によっては、訓練の結果として異なる種類の摂動に対してより脆弱になる可能性があることを示しています。
摂動タイプ間における堅牢性の転移は一貫していない
敵対的堅牢性は、ある摂動タイプから別のタイプへ確実に転移するわけではありません。敵対的例に関する既存の研究の多くは、$L_{\infty}$ および $L_{2}$ に制限された摂動に焦点を当ててきましたが、これらは攻撃者が利用可能な攻撃の全範囲を網羅しているわけではありません。
これをテストするために、OpenAIは、ImageNetの100クラスのサブセットで敵対的に訓練されたモデルに対し、5つの異なる摂動タイプにわたる32種類の異なる攻撃を評価しました。実証的な結果は、ある特定の摂動タイプに対する堅牢性が、他のタイプに対する堅牢性を保証するものではないことを示しています。
評価における摂動サイズの役割
堅牢性が摂動タイプ間で転移するかどうかを理解するには、モデルを幅広い範囲の摂動サイズで評価する必要があります。研究者たちは、評価を狭い範囲のサイズに限定すると、モデルの実際の回復力を不完全または誤解を招く理解につながる可能性があることを発見しました。
敵対的防御における潜在的なトレードオフ
ある種類の摂動に対して堅牢になるようにモデルを訓練することは、他の種類の摂動に対する保護を提供できないだけでなく、場合によってはそれらに対する堅牢性を積極的に低下させる可能性があります。これは、ある攻撃ベクトルに対して防御を行うことが、意図せずして他の摂動タイプに対する新しい脆弱性を生み出す可能性があるという、潜在的なトレードオフを示唆しています。
AI安全性の評価に関する推奨事項
堅牢性は普遍的に転移可能ではないため、OpenAIは、敵対的防御の評価を多様な範囲の摂動タイプとサイズで行うことを推奨しています。単一の指標や、限定された一連の摂動($L_{\infty}$ や $L_{2}$ など)に依存することは、現実世界の敵対的脅威に対する深層ニューラルネットワークのセキュリティと信頼性を検証するには不十分です。