liu00222/Open-Prompt-Injection
This repository provides a benchmark for prompt injection attacks and defenses in LLMs
解决的问题
提供一个标准化的工具包,用于在集成大语言模型(LLM)的应用程序和代理中实现、评估和扩展提示注入攻击与防御,帮助研究人员和开发者基准测试这些漏洞对模型行为的影响。
工作原理
该工具包采用工厂模式创建模型、任务和攻击者。用户可定义目标任务(如情感分析)和注入任务(如垃圾信息检测)以模拟攻击。在防御方面,包含专用组件:DataSentinel 用于检测提示是否被污染,PromptLocate 用于定位提示中被注入的部分,以恢复原始数据。
适用人群
需要测试其 AI 代理和应用程序对提示注入攻击鲁棒性的安全研究人员、AI 开发者和 LLM 实践者。
主要亮点
- 攻击模拟:支持组合攻击策略,以评估攻击成功率(ASV)。
- 检测流水线:配备 DataSentinel,实现基于博弈论的提示注入检测。
- 定位功能:包含 PromptLocate,可识别并隔离注入的提示,实现数据恢复。
- 可扩展框架:通过配置文件轻松更换模型(如 PaLM2、Llama、GPT)和任务。
相关
- 项目
- 项目
- 项目
- 项目