Llama Guard 4 与 Llama Prompt Guard 2 发布

Meta 已发布 Llama Guard 4,这是一款 12B 多模态安全模型,以及 Llama Prompt Guard 2,一系列旨在检测提示注入和越狱的分类器。这些工具使开发者能够过滤用户输入和模型输出,以防止在生产环境中生成不安全内容。

Llama Guard 4:多模态安全审查

Llama Guard 4 是一个密集的 12B 参数模型,旨在检测文本和图像中的不当内容。它可以在配备 24 GB 显存的单个 GPU 上部署,是生产审查流水线的实用选择。该模型能够评估仅文本和图像+文本输入,使其能够在提示到达主 LLM 之前进行过滤,并在助手响应发送给用户之前进行审查。

技术架构与训练

Llama Guard 4 使用密集前馈早期融合架构。它是通过剪枝 Llama 4 Scout 模型(该模型使用混合专家(MoE)架构)而创建的。通过移除所有路由专家和路由层,仅保留共享专家,Meta 开发出一个从预训练共享专家权重初始化的密集模型,无需额外的预训练。

Llama Guard 4 的训练数据由文本仅数据与多模态数据按 3:1 的比例组成,包含多图像训练数据(最多 5 张图像)以及之前用于 Llama Guard 3 的人工标注多语言数据。

危害分类与自定义

Llama Guard 4 根据 MLCommons 危害分类法定义的 14 种危害类型以及代码解释器滥用对内容进行分类。支持的类别包括:

  • S1:暴力犯罪
  • S2:非暴力犯罪
  • S3:性相关犯罪
  • S4:儿童性剥削
  • S5:诽谤
  • S6:专业建议
  • S7:隐私
  • S8:知识产权
  • S9:不加区分的武器
  • S10:仇恨
  • S11:自杀与自残
  • S12:性内容
  • S13:选举
  • S14:代码解释器滥用(仅文本)

用户可以在推理时通过聊天模板排除特定类别键(例如 excluded_category_keys=["S9", "S2", "S1"])来配置检测的类别列表。

性能基准

与 Llama Guard 3 相比,Llama Guard 4 在多个方面表现出提升,尤其是在多图像和英文文本性能上:

类别 召回率 假阳性率 F1 分数 Δ 召回率 Δ 假阳性率 Δ F1 分数
英文 69% 11% 61% +4% -3% +8%
多语言 43% 3% 51% -2% -1% 0%
单图像 41% 9% 38% +10% 0% +8%
多图像 61% 9% 52% +20% -1% +17%

Llama Prompt Guard 2:注入与越狱检测

Llama Prompt Guard 2 包含两个新分类器,参数分别为 86M 和 22M。这些模型专注于检测提示注入和越狱。

关键改进包括:

  • 增强性能:提升的检测能力。
  • 效率:全新、更快且更紧凑的 22M 参数模型。
  • 鲁棒性:更能抵御对抗性攻击的分词方式。
  • 简化分类:二元分类系统(良性 vs 恶意)。

实现与部署

要使用这些模型,用户必须安装 hf_xet 并安装 transformers 库的预览版(v4.51.3-LlamaGuard-preview)。

Llama Guard 4 可以使用 Llama4ForConditionalGenerationAutoProcessor 实现,而 Llama Prompt Guard 2 可以通过 Hugging Face 的 pipeline API 或 AutoModelForSequenceClassification API 部署。

Sources