cure-lab/MMA-Diffusion

[CVPR2024] MMA-Diffusion: MultiModal Attack on Diffusion Models

解決する課題

MMA-Diffusionは、Text-to-Image (T2I) モデルのセキュリティ上の脆弱性、特にプロンプトフィルタや事後セーフティチェッカーなどの安全メカニズムを備えているにもかかわらず、Not-Safe-For-Work (NSFW) コンテンツを生成してしまう可能性に対処します。これは、これらの防御策を回避して、実在する個人の画像に対してNSFWコンテンツを用いた不正な編集を行う方法を実証するものです。

仕組み

このフレームワークは、テキストと画像のモダリティの両方を標的としたマルチモーダル攻撃戦略を採用しています:

  • テキストモダリティ攻撃: プロンプトフィルタを回避して禁止されたコンテンツの生成をトリガーできる敵対的プロンプトを生成します。
  • 画像モダリティ攻撃: 露骨な画像の合成を防ぐために設計された事後セーフティチェッカーを回避するために、敵対的画像を使用します。

対象者

このツールは、主にAIセキュリティの研究者や開発者、特にT2Iモデルの堅牢性の評価や、敵対的攻撃に対するより効果的な防御メカニズムの開発に焦点を当てている方を対象としています。

ハイライト

  • マルチモーダルなアプローチ: テキスト攻撃と視覚的攻撃を組み合わせ、複数の層の安全ガードを回避します。
  • ベンチマークデータセット: 評価用に、1,000件の成功した敵対的プロンプトのベンチマークと、敵対的画像の包括的なデータセットを提供します。
  • 現実的な脅威モデリング: 実在する人物の画像をNSFWコンテンツへと不正に編集できてしまう、T2Iモデルの脆弱性に焦点を当てています。