NVIDIA/garak

the LLM vulnerability scanner

解决的问题

garak 是一个为大型语言模型(LLMs)设计的漏洞扫描器,旨在识别安全弱点和故障模式。它帮助开发者和研究人员在模型部署前,发现模型是否可能被操纵以产生不良输出,例如幻觉、数据泄露、毒性或误导性信息。

工作原理

该工具作为一个红队工具包,结合静态、动态和自适应技术对 LLM 进行探测。其采用模块化架构,包括:

  • 探测器:生成特定交互或攻击向量的模块(例如,提示注入、DAN 等越狱攻击,或基于编码的攻击)。
  • 生成器:连接到目标 LLM 的插件,支持多种接口,包括 Hugging Face、OpenAI、AWS Bedrock 和 REST 端点。
  • 检测器:分析模型响应,判断探测是否成功触发了故障。
  • Harnesses:结构化测试流程并管理探测器与检测器之间的流程的系统。

适用人群

适用于需要自动化扫描模型已知漏洞和安全风险的 AI 安全研究人员、红队成员和 LLM 开发者。

主要亮点

  • 广泛的模型支持:通过 Hugging Face、OpenAI、Replicate、Groq、AWS Bedrock 以及 GGUF 等本地格式,兼容大量模型。
  • 丰富的探测库:包含针对提示注入、恶意软件生成、XSS 和 "故障令牌" 的专用探测器。
  • 自动化评估:为每次探测尝试提供清晰的失败率和详细的 JSONL 日志。
  • 可扩展设计:允许用户轻松创建并集成自定义探测器、检测器和生成器。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch