cure-lab/MMA-Diffusion

[CVPR2024] MMA-Diffusion: MultiModal Attack on Diffusion Models

해결하는 문제

MMA-Diffusion은 Text-to-Image (T2I) 모델의 보안 취약성, 특히 프롬프트 필터 및 사후 안전 검사기와 같은 안전 메커니즘이 있음에도 불구하고 Not-Safe-For-Work (NSFW) 콘텐츠를 생성할 수 있는 취약성을 다룹니다. 이는 이러한 방어 체계를 우회하여 실제 인물의 이미지를 NSFW 콘텐츠로 무단 편집하는 방법을 보여줍니다.

작동 원리

이 프레임워크는 텍스트와 이미지 모달리티를 모두 겨냥한 멀티모달 공격 전략을 채택합니다:

  • 텍스트 모달리티 공격: 프롬프트 필터를 우회하여 금지된 콘텐츠 생성을 유도할 수 있는 적대적 프롬프트를 생성합니다.
  • 이미지 모달리티 공격: 노골적인 이미지 합성을 방지하기 위해 설계된 사후 안전 검사기를 우회하기 위해 적대적 이미지를 사용합니다.

대상자

이 도구는 주로 AI 보안을 연구하는 연구자 및 개발자, 특히 T2I 모델의 견고성을 평가하고 적대적 공격에 대한 더 효과적인 방어 메커니즘을 개발하는 데 집중하는 분들을 위한 것입니다.

주요 특징

  • 멀티모달 접근 방식: 텍스트 및 시각적 공격을 결합하여 여러 단계의 안전 가드를 우회합니다.
  • 벤치마크 데이터셋: 평가를 위해 1,000개의 성공적인 적대적 프롬프트 벤치마크와 포괄적인 적대적 이미지 데이터셋을 제공합니다.
  • 현실적인 위협 모델링: 실제 인물의 이미지를 NSFW 콘텐츠로 무단 편집할 수 있는 T2I 모델의 취약성에 초점을 맞춥니다.