bboylyg/BackdoorLLM
[NeurIPS 2025] BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
解决的问题
BackdoorLLM 解决了在大型语言模型(LLMs)中研究和评估后门攻击与防御的标准化需求。它提供了一个全面的基准,帮助研究人员理解秘密触发器如何被用来操纵 LLM 的行为——例如绕过安全过滤器(越狱)或引导情感倾向——以及如何防御这些漏洞。
工作原理
该项目提供了一个标准化的流程,用于使用四种主要攻击策略创建和测试后门模型:
- 数据污染(DPA):使用 LoRA 在干净数据和污染数据的混合数据上对模型进行微调。
- 权重污染(WPA):使用模型编辑技术直接将后门注入权重中。
- 隐藏状态攻击(HSA):使用激活控制来操纵模型内部状态。
- 思维链攻击(CoTA):利用 CoT 推理来触发特定行为。
它还包含 Backdoor-DefenseBox,一个包含七种防御方法的工具包,涵盖从提示和生成过滤到模型修复(剪枝、微调、量化)以及解码时调整。
适用人群
此工具专为希望评估 LLM 对对抗性污染的鲁棒性并开发更安全部署策略的 AI 安全研究人员和实践者设计。
主要亮点
- 全面的基准:支持多种 LLM 架构(如 Llama、Mistral)和多样化的数据集(如 Stanford Alpaca、AdvBench)。
- 多样的攻击向量:涵盖数据、权重、隐藏状态和基于推理的攻击。
- 集成的防御套件:包含 7 种代表性缓解技术,便于系统性比较。
- 实用工具:提供基于 Web 的演示,用于与后门模型交互并评估攻击成功率(ASR)。
相关
- 项目
- 项目
- 项目
- 项目