敵対的例を用いた機械学習への攻撃
TL;DR
敵対的例は、機械学習モデルを間違いを起こさせるように意図的に設計された入力であり、機械のための「光学的錯覚」として機能します。その存在は、単純な現代アルゴリズムであっても設計者の意図しない振る舞いを示し、AIの安全性にとって具体的かつ緊急の課題であることを示しています。
敵対的例の理解
敵対的例は、機械学習モデルをデータの誤分類または不適切な行動を引き起こすように特別に作成された入力です。これらの摂動はしばしば人間には感知できないほど微細ですが、AIシステムに対して非常に効果的です。
クロスメディアの脆弱性
- デジタル画像: パンダの画像に小さな摂動を加えると、モデルがそれを高い確信でギボンと認識する原因となることがあります。
- 物理世界: 敵対的例は標準的な紙に印刷し、スマートフォンで撮影しても、依然として分類器をだますことができます(例:「洗濯機」を「金庫」とラベル付けする)。
- 重要インフラストラクチャ: 攻撃者はステッカーや塗料を使って停止標識を変更し、自動運転車がそれを「譲り」標識やその他のマークと解釈する可能性があります。
強化学習(RL)への影響
画像分類に加えて、強化学習エージェントも同様に脆弱です。DQN、TRPO、A3Cアルゴリズムを含む研究では、敵対的入力がパフォーマンスを低下させ、エージェントがポンのパドルを間違った方向に動かしたり、人間には知覚できないほど微細な摂動でもSeaquestで敵を見逃す原因となることを示しています。
試みられた防御とその限界
重み減衰やドロップアウトなどの従来のロバストネス技術は、一般的に敵対的例に対して無効です。ただし、2つの専門的な方法のみが重要な防御を提供してきましたが、両方とも攻撃者の計算能力の向上に対して依然として脆弱です。
効果的な防御戦略
- 敵対的トレーニング: モデルを大量に生成された敵対的例で明示的に訓練し、それらによってだまされるのを防ぐ brute-force アプローチ。
- 防御的ディスティレーション: モデルがハードな決定ではなく異なるクラスの確率を出力するように訓練される戦略です。これらの確率は、同じタスクで訓練された以前のモデルによって提供され、モデルの表面を滑らかにし、攻撃者が悪用可能な調整を見つけることを難しくします。
グラディアントマスキングの失敗
"グラディアントマスキング" は、攻撃者が有用な勾配にアクセスできないようにしようとする失敗した防御のカテゴリーを説明します。ほとんどの攻撃は、間違ったクラスの確率を高める方向に入力を摂動させるためにモデルの勾配を使用するため、勾配をマスキングする(たとえば、確率ではなく最も可能性の高いクラスのみを出力すること)は効果的のように見えます。
しかし、グラディアントマスキングは次の理由で失敗します:
- 脆弱性の持続性: モデルの防御における「穴」は依然として存在し、攻撃者は単にそれらを見つける手がかりが少なくなるだけです。
- 代替モデル: 攻撃者は、「代替モデル」―防御されたモデルのラベルを観察して模倣する滑らかなコピー―を訓練することができます。その後、攻撃者は代替モデルの勾配を使用して敵対的例を作成し、それがしばしば元の防御されたモデルをだますことに成功します。
OpenAIは、敵対的トレーニングと防御的ディスティレーションの両方が意図せずにグラディアントマスキングの一形態を実行し、しばしばモデルを平坦化し、より多くの点が正しく分類されることを確保するのではなく、そうであると指摘しています。
敵対的例に対する防御が難しい理由
MLモデルを敵対的攻撃から守ることは、いくつかの基本的な理由により複雑な研究問題です。
- 理論モデルの欠如: 敵対的例は非線形かつ非凸最適化問題の解です。これらの解を記述する理論的ツールが少ないため、特定の敵対的例の集合を排除する防御であることを証明するのは困難です。
- 入力空間の複雑さ: モデルはすべての可能な入力に対して正しい出力を生成しなければなりませんが、現在のほとんどのモデルは、遭遇する可能性のあるすべての入力のごく一部でしかうまく機能しません。
- 非適応的防御: 現在のほとんどの戦略は適応的ではなく、特定の攻撃をブロックしても、防御メカニズムを認識している攻撃者に対して他の脆弱性が開いたままになります。