THU-BPM/MarkLLM
[EMNLP 2024 Demo] MarkLLM: An Open-Source Toolkit for LLM Watermarking
해결하는 문제
MarkLLM는 대규모 언어 모델(LLM)에서 텍스트 워터마킹 기술을 구현하고 시각화하며 평가할 수 있는 표준화된 툴킷을 제공함으로써 기계 생성 텍스트를 식별하는 문제를 해결합니다. 연구자와 개발자가 AI 생성 콘텐츠의 진위성과 출처를 보장할 수 있도록 도와줍니다.
작동 방식
MarkLLM는 KGW, SynthID-Text, MorphMark와 같은 다양한 워터마킹 알고리즘을 지원하는 통합 구현 프레임워크를 제공합니다. Hugging Face 모델과 연동되어 워터마크가 포함된 텍스트를 생성하고, 이후 해당 워터마크를 탐지할 수 있습니다. 툴킷은 알고리즘의 작동 원리를 설명하는 시각화 도구와 워터마크의 탐지 가능성, 파라프라제이션 또는 단어 삭제와 같은 공격에 대한 강건성, 생성된 텍스트 품질에 미치는 영향을 테스트하는 평가 모듈도 포함합니다.
대상 사용자
텍스트 워터마킹, AI 안전성, 기계 생성 콘텐츠 탐지에 관심이 있는 AI 연구자 및 개발자 커뮤니티를 위한 것입니다.
주요 특징
- 다양한 알고리즘 지원: KGW, Unbiased, SynthID-Text 등 수많은 워터마킹 방법을 구현.
- 포괄적인 평가: 성공률, 텍스트 품질(PPL, BLEU), 다양한 텍스트 편집기 및 공격에 대한 강건성을 측정하는 12가지 도구 포함.
- 통합 인터페이스: 다양한 알고리즘을 간단히 로드하고 호출할 수 있도록
AutoWatermark클래스를 사용. - 시각화 도구: 워터마킹 알고리즘이 다양한 시나리오에서 어떻게 작동하는지 설명하는 맞춤형 도구 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트