NVIDIA/garak
the LLM vulnerability scanner
解決的問題
garak 是為大型語言模型(LLMs)設計的漏洞掃描器,旨在識別安全弱點與故障模式。它幫助開發者與研究人員在模型部署前,發現模型是否可能被操控產生不良輸出,例如幻覺、資料外洩、毒性或誤導性資訊。
工作原理
該工具作為一個紅隊工具包,結合靜態、動態與自適應技術對 LLM 進行探測。其採用模組化架構,包括:
- 探測器:產生特定互動或攻擊向量的模組(例如,提示注入、DAN 等越獄攻擊,或基於編碼的攻擊)。
- 產生器:連接至目標 LLM 的外掛程式,支援多種介面,包括 Hugging Face、OpenAI、AWS Bedrock 與 REST 端點。
- 偵測器:分析模型回應,判斷探測是否成功觸發故障。
- Harnesses:結構化測試流程並管理探測器與偵測器之間流程的系統。
適用對象
適用於需要自動化掃描模型已知漏洞與安全風險的 AI 安全研究人員、紅隊成員與 LLM 開發者。
主要亮點
- 廣泛的模型支援:透過 Hugging Face、OpenAI、Replicate、Groq、AWS Bedrock 以及 GGUF 等本地格式,相容大量模型。
- 豐富的探測庫:包含針對提示注入、惡意軟體產生、XSS 與「故障令牌」的專用探測器。
- 自動化評估:為每次探測嘗試提供清晰的失敗率與詳細的 JSONL 日誌。
- 可擴展設計:允許使用者輕鬆建立並整合自訂探測器、偵測器與產生器。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch