NVIDIA/garak

the LLM vulnerability scanner

解決的問題

garak 是為大型語言模型(LLMs)設計的漏洞掃描器,旨在識別安全弱點與故障模式。它幫助開發者與研究人員在模型部署前,發現模型是否可能被操控產生不良輸出,例如幻覺、資料外洩、毒性或誤導性資訊。

工作原理

該工具作為一個紅隊工具包,結合靜態、動態與自適應技術對 LLM 進行探測。其採用模組化架構,包括:

  • 探測器:產生特定互動或攻擊向量的模組(例如,提示注入、DAN 等越獄攻擊,或基於編碼的攻擊)。
  • 產生器:連接至目標 LLM 的外掛程式,支援多種介面,包括 Hugging Face、OpenAI、AWS Bedrock 與 REST 端點。
  • 偵測器:分析模型回應,判斷探測是否成功觸發故障。
  • Harnesses:結構化測試流程並管理探測器與偵測器之間流程的系統。

適用對象

適用於需要自動化掃描模型已知漏洞與安全風險的 AI 安全研究人員、紅隊成員與 LLM 開發者。

主要亮點

  • 廣泛的模型支援:透過 Hugging Face、OpenAI、Replicate、Groq、AWS Bedrock 以及 GGUF 等本地格式,相容大量模型。
  • 豐富的探測庫:包含針對提示注入、惡意軟體產生、XSS 與「故障令牌」的專用探測器。
  • 自動化評估:為每次探測嘗試提供清晰的失敗率與詳細的 JSONL 日誌。
  • 可擴展設計:允許使用者輕鬆建立並整合自訂探測器、偵測器與產生器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch