liu00222/Open-Prompt-Injection

This repository provides a benchmark for prompt injection attacks and defenses in LLMs

解決的問題

提供一個標準化的工具包,用於在整合大型語言模型(LLM)的應用程式與代理中實現、評估與擴展提示注入攻擊與防禦,協助研究人員與開發者基準測試這些弱點對模型行為的影響。

工作原理

該工具包採用工廠模式建立模型、任務與攻擊者。使用者可定義目標任務(例如情感分析)與注入任務(例如垃圾訊息檢測)以模擬攻擊。在防禦方面,包含專用元件:DataSentinel 用於檢測提示是否已被污染,PromptLocate 用於定位提示中被注入的部分,以恢復原始資料。

適用對象

需要測試其 AI 代理與應用程式對提示注入攻擊韌性的安全研究人員、AI 開發者與 LLM 實務者。

主要亮點

  • 攻擊模擬:支援組合攻擊策略,以評估攻擊成功率(ASV)。
  • 檢測流程:內建 DataSentinel,實現基於博弈論的提示注入檢測。
  • 定位功能:包含 PromptLocate,可識別並隔離注入的提示,實現資料恢復。
  • 可擴展框架:透過設定檔輕鬆切換模型(如 PaLM2、Llama、GPT)與任務。

相關

  • 專案
  • 專案
  • 專案
  • 專案