AI 워터마킹 101: 도구와 기법

AI 워터마킹은 합성 콘텐츠에 진위와 출처를 표시하는 중요한 메커니즘으로, 딥페이크와 허위 정보의 확산에 대한 주요 방어 수단으로 작용합니다. 완벽하지는 않지만, 이러한 기법은 여러 형태의 AI 생성 데이터를 알고리즘이나 인간이 식별할 수 있게 합니다.

워터마킹 기본 원리 및 구현

워터마킹은 디지털 콘텐츠에 패턴을 삽입하여 인간이 인식할 수 있는(가시 워터마크) 또는 알고리즘이 감지할 수 있는(비가시 워터마크) 형태로 구현합니다. 구현 시점은 크게 두 가지가 있습니다:

  • During Generation: 워터마크는 모델의 생성 과정에 자동으로 삽입됩니다. 이는 모델에 접근할 수 있어야 하지만 일반적으로 더 견고한 워터마크를 제공합니다.
  • Post-Generation: 콘텐츠가 생성된 후에 워터마크를 추가합니다. 이 방법은 폐쇄형 또는 독점 모델에 적용 가능하지만 텍스트와 같이 모든 데이터 유형에 적용되지 않을 수 있습니다.

데이터 중독 및 서명 기법

표준 워터마킹 외에도, 다른 기법들이 AI 조작으로부터 콘텐츠를 보호합니다:

  • Image Cloaking/Poisoning: Glaze, Photoguard, Nightshade, Fawkes와 같은 도구는 이미지를 눈에 띄지 않게 변형합니다. 일부는 AI 알고리즘이 이미지를 올바르게 처리하지 못하도록 하여 새로운 버전 생성을 차단하고, 다른 일부는 훈련 데이터를 "중독"시켜 AI 훈련 알고리즘의 가정을 깨뜨려 시스템이 사람의 가짜 이미지를 생성하기 어렵게 만듭니다.
  • Content Signing: Truepic이 사용하는 기술처럼 C2PA standard에 따라 메타데이터를 삽입합니다. 이는 콘텐츠를 출처 메타데이터와 연결하며, 인증을 통해 검증함으로써 단순 메타데이터 편집을 방지합니다.

오픈 vs. 클로즈드 워터마킹 시스템

오픈 워터마킹 시스템과 클로즈드 워터마킹 시스템 사이에는 전략적인 트레이드오프가 존재합니다. 오픈 코드는 혁신을 촉진하지만 악의적인 행위자가 워터마크 단계를 쉽게 제거하거나 탐지기가 낮은 신뢰도를 반환할 때까지 콘텐츠를 편집할 수 있게 합니다. 하이브리드 접근 방식은 이를 균형 잡으려 시도합니다; 예를 들어, Truepic은 클로즈드 워터마크 코드를 사용하지만 검증을 위한 공개 JavaScript 라이브러리를 제공하고, IMATAG은 실제 워터마커와 탐지기를 비공개로 유지하면서 생성 호출 코드는 오픈합니다.

모달리티별 워터마킹 기법

이미지 워터마킹

이미지 워터마킹은 훈련 데이터 보호와 출력에 대한 표시 두 가지에 초점을 맞춥니다.

  • Training Data Protection: Nightshade는 눈에 띄지 않는 변화를 이용해 중독된 데이터로 훈련된 모델의 품질에 영향을 주며, Fawkes는 사람 이미지에 대한 얼굴 인식을 방해합니다.
  • Output Watermarking: IMATAG는 Stable Diffusion XL Turbo와 같은 모델의 변형 버전을 활용해 생성 중에 워터마크를 삽입합니다. Truepic은 생성 후에 보이지 않는 콘텐츠 인증과 C2PA 메타데이터를 추가합니다.

텍스트 워터마킹

텍스트 워터마킹은 LLM 생성 과정에서 토큰 확률을 조작함으로써 구현됩니다. 후보 토큰은 이전 텍스트를 기준으로 "red"와 "green" 그룹으로 나뉘며, "green" 그룹은 촉진(Soft Watermark)되고, "red" 그룹은 제한(Hard Watermark)됩니다.

  • Implementation: Watermark for LLMs Space는 OPT와 Flan-T5와 같은 모델에서 이를 시연합니다. 실제 서비스에서는 Text Generation Inference (TGI) 툴킷이 이 알고리즘을 구현합니다.
  • Challenges: 텍스트가 짧을수록 탐지 신뢰도가 낮아지고, 높은 오탐률이 발생할 수 있습니다. 특정 모델을 알지 못하고 AI 텍스트를 탐지하는 범용 텍스트 워터마킹은 현재 불가능하다고 여겨지며, 이는 OpenAI가 2023년에 정확도 문제로 자체 탐지 도구를 폐기한 사례에서 확인됩니다.

오디오 워터마킹

오디오 워터마킹은 보안 인증에 사용되는 바이오메트릭 음성 프린트를 보호하는 데 필수적입니다. 대부분의 기법은 인간이 인지하지 못하는 주파수(보통 20Hz 이하 또는 20,000Hz 이상)에 메타데이터를 삽입합니다.

  • AudioSeal: 최신의 음성 국소화 워터마킹 방법입니다. 워터마크를 삽입하는 생성기와 편집 후에도 긴 오디오 파일에서 워터마크 조각을 찾는 탐지기를 공동으로 학습합니다. AudioSeal은 SeamlessExpressiveSeamlessStreaming 데모에서 안전성을 보장하기 위해 사용됩니다.

Sources