cure-lab/MMA-Diffusion
[CVPR2024] MMA-Diffusion: MultiModal Attack on Diffusion Models
解决的问题
MMA-Diffusion 解决了 Text-to-Image (T2I) 模型的安全漏洞,特别是尽管拥有提示词过滤器和事后安全检查器等安全机制,模型仍可能生成不适宜工作(NSFW)内容的问题。它展示了如何绕过这些防御措施,对真实人物的图像进行包含 NSFW 内容的未经授权的编辑。
工作原理
该框架采用了一种针对文本和图像模态的多模态攻击策略:
- 文本模态攻击:生成可以规避提示词过滤器并触发生成违禁内容的对抗性提示词。
- 图像模态攻击:使用对抗性图像来绕过旨在防止合成露骨图像的事后安全检查器。
适用对象
该工具主要面向从事 AI 安全研究的学者和开发人员,特别是那些专注于评估 T2I 模型鲁棒性并开发更有效的对抗性攻击防御机制的人员。
亮点
- 多模态方法:结合文本和视觉攻击来绕过多层安全防护。
- 基准数据集:提供包含 1,000 个成功对抗性提示词的基准以及用于评估的全面对抗性图像数据集。
- 现实威胁建模:专注于 T2I 模型在未经授权将真实人物图像编辑为 NSFW 内容方面的脆弱性。