bboylyg/BackdoorLLM

[NeurIPS 2025] BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models

解决的问题

BackdoorLLM 解决了在大型语言模型(LLMs)中研究和评估后门攻击与防御的标准化需求。它提供了一个全面的基准,帮助研究人员理解秘密触发器如何被用来操纵 LLM 的行为——例如绕过安全过滤器(越狱)或引导情感倾向——以及如何防御这些漏洞。

工作原理

该项目提供了一个标准化的流程,用于使用四种主要攻击策略创建和测试后门模型:

  • 数据污染(DPA):使用 LoRA 在干净数据和污染数据的混合数据上对模型进行微调。
  • 权重污染(WPA):使用模型编辑技术直接将后门注入权重中。
  • 隐藏状态攻击(HSA):使用激活控制来操纵模型内部状态。
  • 思维链攻击(CoTA):利用 CoT 推理来触发特定行为。

它还包含 Backdoor-DefenseBox,一个包含七种防御方法的工具包,涵盖从提示和生成过滤到模型修复(剪枝、微调、量化)以及解码时调整。

适用人群

此工具专为希望评估 LLM 对对抗性污染的鲁棒性并开发更安全部署策略的 AI 安全研究人员和实践者设计。

主要亮点

  • 全面的基准:支持多种 LLM 架构(如 Llama、Mistral)和多样化的数据集(如 Stanford Alpaca、AdvBench)。
  • 多样的攻击向量:涵盖数据、权重、隐藏状态和基于推理的攻击。
  • 集成的防御套件:包含 7 种代表性缓解技术,便于系统性比较。
  • 实用工具:提供基于 Web 的演示,用于与后门模型交互并评估攻击成功率(ASR)。

相关

  • 项目
  • 项目
  • 项目
  • 项目