meta-llama/PurpleLlama

Set of tools to assess and improve LLM security.

解决的问题

Purple Llama 是一个旨在帮助社区负责任地使用开源生成式 AI 模型的统合项目。它通过提供一系列工具和评估方法,解决与大语言模型(LLM)相关的风险,特别是网络安全威胁、恶意提示以及生成不安全代码的问题。

如何工作

该项目采用“紫队”(purple teaming)方法,结合攻击(红队)与防御(蓝队)策略,以评估和缓解风险。它提供三大类工具:

  • 系统级防护:包括 Llama Guard,一系列用于检测违规内容的审核模型;Prompt Guard,用于防范提示注入和越狱攻击;以及 Code Shield,在推理时过滤 LLM 生成的不安全代码。
  • 评估与基准测试CyberSec Eval 系列(v1、v2 和 v3)提供行业标准基准,用于量化网络安全风险、衡量代码解释器被滥用的可能性,并测试视觉提示注入和鱼叉式网络钓鱼能力。

适用对象

需要为开源生成式 AI 模型部署信任、安全与防护层,以确保其应用安全并符合内容规范的开发者和研究人员。

主要亮点

  • Llama Guard 3:高性能审核模型,支持多语言,具备 128k 上下文窗口,支持图像推理。
  • Prompt Guard:专门用于检测并阻止提示注入和越狱尝试的工具。
  • Code Shield:在推理时进行过滤,防止不安全代码执行或代码解释器被滥用。
  • CyberSec Eval:基于行业标准(CWE 和 MITRE ATT&CK)的综合性基准测试套件,用于评估 LLM 的网络安全风险。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • Dispatch