confident-ai/deepteam

DeepTeam is a framework to red team LLMs and AI agents.

解决的问题

DeepTeam 为 LLM 系统(包括 AI 代理、RAG 流水线和聊天机器人)提供了一种结构化的方式来进行红队测试(对抗性渗透测试)。它帮助开发者在系统进入生产环境前识别安全漏洞、安全风险和伦理偏见,并提供实时阻止这些威胁的工具。

工作原理

DeepTeam 使用 model_callback 包装 LLM 应用程序,然后对其施加动态生成的对抗性攻击。它利用 LLM-as-a-Judge 指标评估响应并生成二元通过/失败评分。该框架支持:

  • 漏洞探测:涵盖数据隐私、负责任的 AI、安全(如 SQL 注入)、安全性和代理风险等类别的 50 多个预定义漏洞。
  • 对抗性攻击:包含 20 多种基于研究的方法,包括单轮攻击(提示注入、Base64 编码、角色扮演)和多轮对话攻击(Crescendo 和 Tree Jailbreaking)。
  • 安全框架:开箱即用地映射到行业标准,如 OWASP LLM/Agent 榜单、NIST AI RMF 和 MITRE ATLAS。
  • 防护机制:实时二元分类器,监控输入和输出,以在生产环境中阻止违规内容。

适用人群

专为需要对 LLM 应用进行安全与合规性压力测试的 AI 开发者和安全工程师设计,尤其适用于构建复杂代理系统或 RAG 流水线的用户。

主要亮点

  • 全面的攻击库:包含大量前沿的越狱和混淆技术。
  • 代理专用测试:针对代理风险(如目标窃取、递归劫持、工具编排滥用)的专用漏洞。
  • 框架集成:自动与全球 AI 安全标准(OWASP、NIST、MITRE)对齐。
  • 本地执行:可在用户本地机器上运行,基于 DeepEval 框架构建。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目