KeyValueSoftwareSystems/agent-opfor

Open-source adversary emulation for AI agents and MCP servers.

何を解決するか

Opfor は、AIエージェント、LLMアプリケーション、MCPサーバーの赤チーム化を目的とした敵対エミュレーションツールです。開発者やセキュリティチームがプロンプトインジェクション、ジャイルブレイク、ツールの誤用、機密データの漏洩などの脆弱性を本番環境にデプロイする前に特定できるように支援します。

動作方法

Opfor は業界標準(OWASPなど)に基づいて、ターゲットエージェントに向けた攻撃用の敵対的プロンプトを生成し、リアルな攻撃をエミュレートします。その後、攻撃を実行し、応答をキャプチャし、LLMベースのジャッジが各試行を「成功」または「失敗」と分類し、詳細な理由を提示します。また、Langfuse や Netra などの観測スタックと統合可能で、最終出力だけでなく、内部のツール呼び出しや推論ステップも分析できます。

対象ユーザー

  • エンジニアおよびDevOps: CLI や SDK を使って CI/CD パイプラインに赤チーム化を統合。
  • プロダクトマネージャーおよびQA: ブラウザ拡張機能を使ってコードを書かずにデプロイ済みチャットボットをテスト。
  • セキュリティアナリスト: 業界標準のOWASPスイートを使ってコンプライアンスと安全性を確保。
  • AI開発者: MCPサーバーモードを使って、自身のコーディングエージェントが他のエージェントをテストできるようにする。

主な特徴

  • 包括的なカバレッジ: OWASP LLM Top 10、Agentic AI Top 10、MCP Top 10、APIセキュリティ、EU AI Actバイアスのカスタマイズ済みスイートを含む。
  • 複数のエントリポイント: CLI、ブラウザ拡張機能、MCPサーバー、IDEスキル、TypeScript SDK で利用可能。
  • uma 自律的赤チーム化: opfor hunt コマンドは、指揮官、オペレーター、スカウトというマルチエージェントシステムを使用し、自律的にリコンと適応型攻撃キャンペーンを実行。
  • トレース対応テスト: テレメトリプロバイダーと統合し、最終応答には現れないが内部ツール呼び出しで発生する漏洩を検出。
  • 透明性のあるレポート: 攻撃プロンプトとジャッジの判断を完全に記録したHTMLおよびJSON形式のレポートを生成。テストコスト(トークン使用量)の詳細な分解も提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト