NVIDIA/garak
the LLM vulnerability scanner
解决的问题
garak 是一个为大型语言模型(LLMs)设计的漏洞扫描器,旨在识别安全弱点和故障模式。它帮助开发者和研究人员在模型部署前,发现模型是否可能被操纵以产生不良输出,例如幻觉、数据泄露、毒性或误导性信息。
工作原理
该工具作为一个红队工具包,结合静态、动态和自适应技术对 LLM 进行探测。其采用模块化架构,包括:
- 探测器:生成特定交互或攻击向量的模块(例如,提示注入、DAN 等越狱攻击,或基于编码的攻击)。
- 生成器:连接到目标 LLM 的插件,支持多种接口,包括 Hugging Face、OpenAI、AWS Bedrock 和 REST 端点。
- 检测器:分析模型响应,判断探测是否成功触发了故障。
- Harnesses:结构化测试流程并管理探测器与检测器之间的流程的系统。
适用人群
适用于需要自动化扫描模型已知漏洞和安全风险的 AI 安全研究人员、红队成员和 LLM 开发者。
主要亮点
- 广泛的模型支持:通过 Hugging Face、OpenAI、Replicate、Groq、AWS Bedrock 以及 GGUF 等本地格式,兼容大量模型。
- 丰富的探测库:包含针对提示注入、恶意软件生成、XSS 和 "故障令牌" 的专用探测器。
- 自动化评估:为每次探测尝试提供清晰的失败率和详细的 JSONL 日志。
- 可扩展设计:允许用户轻松创建并集成自定义探测器、检测器和生成器。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch