confident-ai/deepteam

DeepTeam is a framework to red team LLMs and AI agents.

解決的問題

DeepTeam 提供一種結構化的方式,對 LLM 系統(包括 AI 代理、RAG 流水線和聊天機器人)進行紅隊測試(對抗性滲透測試)。它幫助開發者在系統進入生產環境前,識別安全漏洞、安全風險與倫理偏見,並提供即時阻止這些威脅的工具。

工作原理

DeepTeam 使用 model_callback 包裝 LLM 應用程式,然後對其施加動態生成的對抗性攻擊。它利用 LLM-as-a-Judge 指標評估回應,並產生二元通過/失敗分數。此框架支援:

  • 漏洞探測:涵蓋資料隱私、負責任的 AI、安全性(例如 SQL 注入)、安全性與代理風險等類別的 50 多個預定義漏洞。
  • 對抗性攻擊:包含 20 多種基於研究的方法,包括單回合攻擊(提示注入、Base64 編碼、角色扮演)與多回合對話攻擊(Crescendo 與 Tree Jailbreaking)。
  • 安全框架:開箱即用地對應產業標準,如 OWASP LLM/Agent 榜單、NIST AI RMF 與 MITRE ATLAS。
  • 防護機制:即時二元分類器,監控輸入與輸出,以在生產環境中阻止違規內容。

適用對象

專為需要對 LLM 應用進行安全與合規性壓力測試的 AI 開發者與安全工程師設計,尤其適用於建構複雜代理系統或 RAG 流水線的使用者。

主要亮點

  • 全面的攻擊程式庫:包含大量先進的越獄與混淆技術。
  • 代理專用測試:針對代理風險(如目標竊取、遞迴劫持、工具編排濫用)的專用漏洞。
  • 框架整合:自動與全球 AI 安全標準(OWASP、NIST、MITRE)對齊。
  • 本地執行:可在使用者本地機器上執行,基於 DeepEval 框架建構。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案