Llama Guard 4 与 Llama Prompt Guard 2 发布
Meta 已发布 Llama Guard 4,这是一款 12B 多模态安全模型,以及 Llama Prompt Guard 2,一系列旨在检测提示注入和越狱的分类器。这些工具使开发者能够过滤用户输入和模型输出,以防止在生产环境中生成不安全内容。
Llama Guard 4:多模态安全审查
Llama Guard 4 是一个密集的 12B 参数模型,旨在检测文本和图像中的不当内容。它可以在配备 24 GB 显存的单个 GPU 上部署,是生产审查流水线的实用选择。该模型能够评估仅文本和图像+文本输入,使其能够在提示到达主 LLM 之前进行过滤,并在助手响应发送给用户之前进行审查。
技术架构与训练
Llama Guard 4 使用密集前馈早期融合架构。它是通过剪枝 Llama 4 Scout 模型(该模型使用混合专家(MoE)架构)而创建的。通过移除所有路由专家和路由层,仅保留共享专家,Meta 开发出一个从预训练共享专家权重初始化的密集模型,无需额外的预训练。
Llama Guard 4 的训练数据由文本仅数据与多模态数据按 3:1 的比例组成,包含多图像训练数据(最多 5 张图像)以及之前用于 Llama Guard 3 的人工标注多语言数据。
危害分类与自定义
Llama Guard 4 根据 MLCommons 危害分类法定义的 14 种危害类型以及代码解释器滥用对内容进行分类。支持的类别包括:
- S1:暴力犯罪
- S2:非暴力犯罪
- S3:性相关犯罪
- S4:儿童性剥削
- S5:诽谤
- S6:专业建议
- S7:隐私
- S8:知识产权
- S9:不加区分的武器
- S10:仇恨
- S11:自杀与自残
- S12:性内容
- S13:选举
- S14:代码解释器滥用(仅文本)
用户可以在推理时通过聊天模板排除特定类别键(例如 excluded_category_keys=["S9", "S2", "S1"])来配置检测的类别列表。
性能基准
与 Llama Guard 3 相比,Llama Guard 4 在多个方面表现出提升,尤其是在多图像和英文文本性能上:
| 类别 | 召回率 | 假阳性率 | F1 分数 | Δ 召回率 | Δ 假阳性率 | Δ F1 分数 |
|---|---|---|---|---|---|---|
| 英文 | 69% | 11% | 61% | +4% | -3% | +8% |
| 多语言 | 43% | 3% | 51% | -2% | -1% | 0% |
| 单图像 | 41% | 9% | 38% | +10% | 0% | +8% |
| 多图像 | 61% | 9% | 52% | +20% | -1% | +17% |
Llama Prompt Guard 2:注入与越狱检测
Llama Prompt Guard 2 包含两个新分类器,参数分别为 86M 和 22M。这些模型专注于检测提示注入和越狱。
关键改进包括:
- 增强性能:提升的检测能力。
- 效率:全新、更快且更紧凑的 22M 参数模型。
- 鲁棒性:更能抵御对抗性攻击的分词方式。
- 简化分类:二元分类系统(良性 vs 恶意)。
实现与部署
要使用这些模型,用户必须安装 hf_xet 并安装 transformers 库的预览版(v4.51.3-LlamaGuard-preview)。
Llama Guard 4 可以使用 Llama4ForConditionalGeneration 和 AutoProcessor 实现,而 Llama Prompt Guard 2 可以通过 Hugging Face 的 pipeline API 或 AutoModelForSequenceClassification API 部署。