liu00222/Open-Prompt-Injection

This repository provides a benchmark for prompt injection attacks and defenses in LLMs

解决的问题

提供一个标准化的工具包,用于在集成大语言模型(LLM)的应用程序和代理中实现、评估和扩展提示注入攻击与防御,帮助研究人员和开发者基准测试这些漏洞对模型行为的影响。

工作原理

该工具包采用工厂模式创建模型、任务和攻击者。用户可定义目标任务(如情感分析)和注入任务(如垃圾信息检测)以模拟攻击。在防御方面,包含专用组件:DataSentinel 用于检测提示是否被污染,PromptLocate 用于定位提示中被注入的部分,以恢复原始数据。

适用人群

需要测试其 AI 代理和应用程序对提示注入攻击鲁棒性的安全研究人员、AI 开发者和 LLM 实践者。

主要亮点

  • 攻击模拟:支持组合攻击策略,以评估攻击成功率(ASV)。
  • 检测流水线:配备 DataSentinel,实现基于博弈论的提示注入检测。
  • 定位功能:包含 PromptLocate,可识别并隔离注入的提示,实现数据恢复。
  • 可扩展框架:通过配置文件轻松更换模型(如 PaLM2、Llama、GPT)和任务。

相关

  • 项目
  • 项目
  • 项目
  • 项目