meta-llama/PurpleLlama
Set of tools to assess and improve LLM security.
解决的问题
Purple Llama 是一个旨在帮助社区负责任地使用开源生成式 AI 模型的统合项目。它通过提供一系列工具和评估方法,解决与大语言模型(LLM)相关的风险,特别是网络安全威胁、恶意提示以及生成不安全代码的问题。
如何工作
该项目采用“紫队”(purple teaming)方法,结合攻击(红队)与防御(蓝队)策略,以评估和缓解风险。它提供三大类工具:
- 系统级防护:包括 Llama Guard,一系列用于检测违规内容的审核模型;Prompt Guard,用于防范提示注入和越狱攻击;以及 Code Shield,在推理时过滤 LLM 生成的不安全代码。
- 评估与基准测试:CyberSec Eval 系列(v1、v2 和 v3)提供行业标准基准,用于量化网络安全风险、衡量代码解释器被滥用的可能性,并测试视觉提示注入和鱼叉式网络钓鱼能力。
适用对象
需要为开源生成式 AI 模型部署信任、安全与防护层,以确保其应用安全并符合内容规范的开发者和研究人员。
主要亮点
- Llama Guard 3:高性能审核模型,支持多语言,具备 128k 上下文窗口,支持图像推理。
- Prompt Guard:专门用于检测并阻止提示注入和越狱尝试的工具。
- Code Shield:在推理时进行过滤,防止不安全代码执行或代码解释器被滥用。
- CyberSec Eval:基于行业标准(CWE 和 MITRE ATT&CK)的综合性基准测试套件,用于评估 LLM 的网络安全风险。
相关
- 项目
- Dispatch
- 项目
- 项目
- Dispatch