liu00222/Open-Prompt-Injection

This repository provides a benchmark for prompt injection attacks and defenses in LLMs

何を解決するか

大規模言語モデル(LLM)統合アプリケーションやエージェントにおけるプロンプトインジェクション攻撃および防御の実装、評価、拡張のための標準化されたツールキットを提供し、研究者や開発者がこれらの脆弱性がモデルの挙動に与える影響をベンチマークできるように支援します。

動作方法

このツールキットはファクトリーベースのアプローチを採用し、モデル、タスク、攻撃者を生成します。ユーザーはターゲットタスク(例:センチメント分析)とインジェクションタスク(例:スパム検出)を定義して攻撃をシミュレートできます。防御機能には、DataSentinel(プロンプトが汚染されているかどうかを検出する)と、PromptLocate(インジェクションされた部分を特定して元のデータを復元する)という専用コンポーネントが含まれます。

対象ユーザー

AIエージェントやアプリケーションのプロンプトインジェクション攻撃に対する耐性をテストしたいセキュリティ研究者、AI開発者、LLM実務者。

主な特徴

  • 攻撃シミュレーション:攻撃成功値(ASV)を評価するための複合攻撃戦略をサポート。
  • 検出パイプライン:ゲーム理論に基づくプロンプトインジェクション検出に特化した DataSentinel を搭載。
  • 局所化機能:インジェクションされたプロンプトを特定・分離し、データ復元を可能にする PromptLocate を提供。
  • 拡張可能なフレームワーク:設定ファイルを使用して、モデル(例:PaLM2、Llama、GPT)やタスクを簡単に切り替え可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト