confident-ai/deepteam
DeepTeam is a framework to red team LLMs and AI agents.
何を解決するか
DeepTeamは、LLMシステム(AIエージェント、RAGパイプライン、チャットボットなど)に対して赤チーム(敵対的侵入テスト)を構造的に実施する方法を提供します。開発者が本番環境に到達する前に、セキュリティ上の脆弱性、安全性のリスク、倫理的バイアスを特定し、リアルタイムでこれらの脅威をブロックするためのツールを提供します。
動作方法
DeepTeamはmodel_callbackを使用してLLMアプリケーションをラップし、動的に生成された敵対的攻撃にさらします。LLM-as-a-Judgeメトリクスを活用して応答を評価し、バイナリの合格/不合格スコアを生成します。このフレームワークは以下の機能をサポートしています:
- 脆弱性プローブ:データプライバシー、責任あるAI、セキュリティ(例:SQLインジェクション)、安全性、エージェントリスクなど、50以上のカテゴリにまたがる事前定義された脆弱性。
- 敵対的攻撃:20以上の研究に基づく手法を含み、単一ターン攻撃(プロンプトインジェクション、Base64エンコーディング、ロールプレイ)と、複数ターン会話攻撃(CrescendoおよびTree Jailbreaking)を含みます。
- 安全性フレームワーク:業界標準(OWASP Top 10 for LLMs/Agents、NIST AI RMF、MITRE ATLAS)への即時マッピングを提供。
- ガードレール:入力と出力をリアルタイムで監視し、本番環境で違反コンテンツをブロックするバイナリ分類器。
対象ユーザー
本フレームワークは、安全性およびセキュリティ準拠を検証する必要があるAI開発者やセキュリティエンジニア向けに設計されており、特に複雑なエージェントシステムやRAGパイプラインを開発している人にとって適しています。
主な特徴
- 広範な攻撃ライブラリ:最先端の jailbreaking およびオブスカレーション技術を多数含む。
- エージェント固有のテスト:ゴール盗難、再帰的ハッキング、ツールオーケストレーションの乱用など、エージェント特有のリスクに対する専用脆弱性。
- フレームワーク統合:グローバルなAIセーフティ基準(OWASP、NIST、MITRE)と自動的に整合。
- ローカル実行:ユーザーのマシン上でローカル実行可能で、DeepEvalフレームワークに基づいて構築されています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト