bboylyg/BackdoorLLM
[NeurIPS 2025] BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
何を解決するか
BackdoorLLMは、大規模言語モデル(LLM)におけるバックドア攻撃と防御を研究・評価するための標準化された方法の必要性に対応しています。研究者が秘密のトリガーがLLMの振る舞い(例:セーフティフィルターの回避(ジャイルブレイク)、感情の操作)を操作する仕組みを理解し、これらの脆弱性に対抗する方法を学ぶための包括的なベンチマークを提供します。
仕組み
このプロジェクトは、4つの主要な攻撃戦略を使用してバックドアモデルの作成とテストを行う標準化されたパイプラインを提供します:
- データ汚染(DPA):LoRAを用いて、清浄データと汚染データの混合データでモデルをファインチューニング。
- 重み汚染(WPA):モデル編集技術を用いて、重みに直接バックドアを注入。
- 隠れ状態攻撃(HSA):活性化の制御を用いて、モデル内部の状態を操作。
- 思考の連鎖攻撃(CoTA):CoT推論を活用して特定の行動をトリガー。
また、Backdoor-DefenseBox というツールキットも含まれており、プロンプトや生成フィルタリングからモデル修復(プルーニング、ファインチューニング、量子化)およびデコード時調整まで、7つの防御手法を網羅しています。
対象ユーザー
このツールは、LLMの敵対的汚染に対する堅牢性を評価し、より安全な展開戦略を開発したいAIセーフティ研究者や実務家向けに設計されています。
特徴
- 包括的なベンチマーク:複数のLLMアーキテクチャ(例:Llama、Mistral)と多様なデータセット(例:Stanford Alpaca、AdvBench)をサポート。
- 多様な攻撃ベクトル:データ、重み、隠れ状態、推論ベースの攻撃をカバー。
- 統合された防御ツールキット:7つの代表的な緩和技術を含み、体系的な比較が可能。
- 実用的なツール:バックドア付きモデルと対話できるWebベースのデモと、攻撃成功率(ASR)の評価機能を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト