bboylyg/BackdoorLLM

[NeurIPS 2025] BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models

解決的問題

BackdoorLLM 解決了在大型語言模型(LLMs)中研究與評估後門攻擊與防禦的標準化需求。它提供了一個全面的基準,幫助研究人員理解秘密觸發器如何被用來操縱 LLM 的行為——例如繞過安全過濾器(越獄)或引導情感傾向——以及如何防禦這些漏洞。

工作原理

此專案提供了一個標準化的流程,用於使用四種主要攻擊策略建立和測試後門模型:

  • 資料污染(DPA):使用 LoRA 在乾淨資料與污染資料的混合資料上對模型進行微調。
  • 權重污染(WPA):使用模型編輯技術直接將後門注入權重中。
  • 隱藏狀態攻擊(HSA):使用激活控制來操縱模型內部狀態。
  • 思考鏈攻擊(CoTA):利用 CoT 推理來觸發特定行為。

它還包含 Backdoor-DefenseBox,一個包含七種防禦方法的工具包,涵蓋從提示與產生過濾到模型修復(剪枝、微調、量化)以及解碼時調整。

適用對象

此工具專為希望評估 LLM 對對抗性污染的韌性並開發更安全部署策略的 AI 安全研究人員與實務者設計。

主要亮點

  • 全面的基準:支援多種 LLM 架構(如 Llama、Mistral)與多樣化的資料集(如 Stanford Alpaca、AdvBench)。
  • 多樣的攻擊向量:涵蓋資料、權重、隱藏狀態與基於推理的攻擊。
  • 整合的防禦套件:包含 7 種代表性緩解技術,便於系統性比較。
  • 實用工具:提供基於 Web 的示範,用於與後門模型互動並評估攻擊成功率(ASR)。

相關

  • 專案
  • 專案
  • 專案
  • 專案