cure-lab/MMA-Diffusion
[CVPR2024] MMA-Diffusion: MultiModal Attack on Diffusion Models
解決的問題
MMA-Diffusion 解決了 Text-to-Image (T2I) 模型的安全性漏洞,特別是儘管擁有提示詞過濾器和事後安全檢查器等安全機制,模型仍可能生成不適宜工作 (NSFW) 內容的問題。它展示了如何繞過這些防禦措施,對真實人物的圖像進行包含 NSFW 內容的未經授權編輯。
工作原理
該框架採用了一種針對文本和圖像模態的多模態攻擊策略:
- 文本模態攻擊:生成可以規避提示詞過濾器並觸發生成違禁內容的對抗性提示詞。
- 圖像模態攻擊:使用對抗性圖像來繞過旨在防止合成露骨圖像的事後安全檢查器。
適用對象
該工具主要面向從事 AI 安全研究的學者和開發人員,特別是那些專注於評估 T2I 模型魯棒性並開發更有效的對抗性攻擊防禦機制的專業人士。
亮點
- 多模態方法:結合文本和視覺攻擊來繞過多層安全防護。
- 基準數據集:提供包含 1,000 個成功對抗性提示詞的基準以及用於評估的全面對抗性圖像數據集。
- 現實威脅建模:專注於 T2I 模型在未經授權將真實人物圖像編輯為 NSFW 內容方面的脆弱性。