msoedov/agentic_security

Agentic LLM Vulnerability Scanner / AI red teaming kit 🧪

解決する課題

Agentic Securityは、大規模言語モデル(LLM)とエージェントワークフローをセキュリティの脅威から保護するために設計されたオープンソースの脆弱性スキャナーです。開発者やセキュリティチームが、ジェイルブレイク、ファジングの脆弱性、マルチモーダル攻撃などの弱点を、本番環境にデプロイする前にプロアクティブに特定するのを支援します。

仕組み

このツールは、さまざまな攻撃ベクトルを使用してLLM APIを調査することで動作します。プレーンテキストのHTTP仕様を使用してターゲットモデルに接続し、プレースホルダーを特定の攻撃プロンプトに置き換えます。Hugging FaceやローカルのCSVファイルからデータセットをロードしたり、安全フィルターを回避するために変異(Base64エンコーディングやROT13など)を使用して動的なデータセットを生成したりすることができます。システムはテキスト、画像、音声のモダリティをサポートしており、自動セキュリティチェックとしてCI/CDパイプラインに統合できます。

対象者

このプロジェクトは、AIシステムをストレス・テストし、敵対的な攻撃に対して堅牢であることを確認する必要があるAI開発者、セキュリティ研究者、およびセキュリティチームを対象としています。

ハイライト

  • マルチモーダル・プロービング: テキスト、画像、音声入力にわたる脆弱性のスキャンをサポート。
  • マルチステップ・ジェイルブレイク: 反復的な攻撃シーケンスをシミュレートして、深い安全性の弱点を明らかにします。
  • RLベースの攻撃: 強化学習を使用して、モデルの防御に対して進化する適応型プローブを作成します。
  • CI/CD統合: 開発中の自動セキュリティスキャンのためのサンプルGitHub Actionが含まれています。
  • 拡張可能なデータセット: ユーザーがカスタムCSVデータセットを追加したり、Hugging Faceから既存のデータセットを統合したりできます。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト