tophant-ai/aibeat

Break your AI before they do. Join Discord: https://discord.gg/8A6mFckxZ

何を解決するか

AI Beat は、生成AI向けのセキュリティ評価フレームワークであり、LLM、RAGアプリ、AIエージェントにおける安全境界と脆弱性を特定することに焦点を当てています。単なるスコアリングを越えて、根拠に基づく結果を提供し、安全に見える最終回答と、実際には不安全な実行パス(例:安全な応答を提供しながら一時ファイルに資格情報を漏洩するエージェント)の違いを明確にします。

動作方法

このプロジェクトは、主に以下の2つのツールで構成されています:

  • PromptBeat:ブラックボックス評価エンジン。攻撃者とジャッジをシミュレートして、LLM、API、RAGアプリの挙動と安全性を評価します。
  • AgentBeat:エージェントランタイムをインストルメント化して評価する拡張機能。ツール呼び出し、コマンド、ファイル変更、トレースイベントなどのランタイム証拠を収集し、エージェントが実行中にセキュリティ境界を越えたかどうかを判断します。

両方のツールは、シナリオ、ケース、レポートの共通モデルを使用しています。AgentBeatは、言語に依存しないマニフェストと特定のHTTPプロトコルを通じてエージェントランタイムに接続するアダプタを使用します。

対象ユーザー

AIシステムの安全性とセキュリティを厳密にテストする必要がある開発者やセキュリティ研究者向けです。特にツールアクセスを持つ自律エージェントを導入するケースに適しています。

特徴

  • 根拠に基づく評価:トレース、環境変更、ファイルアーティファクトを収集し、セキュリティの失敗を証明します。
  • 対称的なワークフロー:ブラックボックス(PromptBeat)とランタイムインストルメント(AgentBeat)の両方で共通のシナリオとレポートモデルを使用します。
  • マルチロールアーキテクチャ:攻撃者、ジャッジ、ターゲットモデルの役割を分離し、バイアスを回避します。
  • 拡張可能なアダプタシステム:タイプ化されたSDKとマニフェストベースの登録により、さまざまなエージェントランタイムとの統合が可能になります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト