bboylyg/BackdoorLLM
[NeurIPS 2025] BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
해결하는 문제
BackdoorLLM은 대규모 언어 모델(LLM)에서 백도어 공격과 방어를 연구하고 평가할 수 있는 표준화된 방법의 필요성을 해결합니다. 연구자들이 비밀 트리거가 LLM의 행동(예: 안전 필터 회피(재판금), 감성 조작)을 조작하는 방식을 이해하고 이러한 취약성에 대응하는 방법을 배울 수 있도록 포괄적인 벤치마크를 제공합니다.
작동 방식
이 프로젝트는 네 가지 주요 공격 전략을 사용하여 백도어 모델을 생성하고 테스트하는 표준화된 파이프라인을 제공합니다:
- 데이터 오염(DPA): LoRA를 사용하여 정제된 데이터와 오염된 데이터의 혼합 데이터로 모델을 피니튜닝.
- 가중치 오염(WPA): 모델 편집을 사용하여 백도어를 직접 가중치에 주입.
- 숨겨진 상태 공격(HSA): 활성화 조정을 사용하여 모델 내부 상태를 조작.
- 사고의 연쇄 공격(CoTA): CoT 추론을 활용하여 특정 행동을 트리거.
또한 Backdoor-DefenseBox라는 툴킷을 포함하며, 프롬프트 및 생성 필터링에서 모델 수리(프루닝, 피니튜닝, 양자화) 및 디코딩 시 조정에 이르기까지 7가지 방어 방법을 포함합니다.
대상 사용자
이 도구는 LLM의 적대적 오염에 대한 강건성을 평가하고 더 안전한 배포 전략을 개발하고자 하는 AI 안전 연구자 및 실무자에게 적합합니다.
주요 특징
- 포괄적인 벤치마크: 다양한 LLM 아키텍처(예: Llama, Mistral)와 다양한 데이터셋(예: Stanford Alpaca, AdvBench)을 지원.
- 다양한 공격 벡터: 데이터, 가중치, 숨겨진 상태, 추론 기반 공격을 모두 커버.
- 통합된 방어 툴킷: 체계적인 비교를 위한 7가지 대표적인 완화 기법을 포함.
- 실용적인 도구: 백도어가 포함된 모델과 상호작용하고 공격 성공률(ASR)을 평가할 수 있는 웹 기반 데모 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트