ニューラルネットワークポリシーに対する敵対的攻撃

OpenAI研究者は、強化学習(RL)で使用されるニューラルネットワークポリシーが、コンピュータビジョン分類器で以前に特定された脆弱性と同様に、敵対的攻撃に対して脆弱であることを示した。生の入力データに小さくて慎重に作られた摂動を導入することにより、敵対者は人間の知覚に干渉することなく、訓練済みポリシーのテスト時のパフォーマンスを著しく低下させることができる。

強化学習ポリシーの脆弱性

強化学習におけるニューラルネットワークポリシーは、モデルを誤った決定に強制するために特別に構築された入力である敵対的例に対して脆弱である。この現象は画像認識の機械学習分類器でよく文書化されていたが、この研究は同じ脆弱性がRLエージェントの意思決定ポリシーにも及ぶことを確認した。

学習されたタスクや使用された特定のトレーニングアルゴリズムにかかわらず、研究者は敵対的摂動を受けた際にエージェントのパフォーマンスが著しく低下することを観察した。これは、ニューラルネットワークポリシーが入力データを処理して行動を決定する方法にシステム的な脆弱性があることを示している。

脅威モデルと攻撃手法

この研究では、敵対者がポリシーの生の入力に小さな摂動を導入できる脅威モデルを利用している。これらの摂動は、人間に知覚されない程度に最小限に抑えられるように設計されているが、ニューラルネットワークを誤導するには十分である。

攻撃設定

この研究は、さまざまなシナリオにおける脆弱性の程度を特徴付けた:

  • ホワイトボックス設定: 敵対者はポリシーの内部パラメータとアーキテクチャを完全に知っている。
  • ブラックボックス設定: 敵対者はポリシーの内部動作について限られた知識しか持たないか、まったく知識がない。

両方の設定において、既存の敵対的例作成技術は訓練済みポリシーのパフォーマンスを低下させるのに効果的だった。

AIセーフティへの影響

RLポリシーが知覚できない入力変化によって簡単に乱されるという発見は、自律エージェントの展開における重大なセキュリティギャップを示唆している。これらの攻撃がさまざまなタスクおよびトレーニングアルゴリズムで機能するため、この脆弱性は特定の実装の欠陥ではなく、現在強化学習に使用されているニューラルネットワークアーキテクチャの基本的な特性であるように見える。

Sources