GLiGuard:以高效小型语言模型实现 AI 安全的规模化

随着 AI 代理从简单的聊天机器人转变为能够浏览网页和执行代码的自主实体,LLM 部署的风险画像已经发生变化。风险不再仅仅是关于攻击性文本,而是关于防止现实世界的伤害。为降低这些风险,开发者依赖于安全护栏——位于用户与模型之间的安全层,用于过滤恶意提示和有害响应。

历史上,最先进(SOTA)的安全护栏模型都是基于大型仅解码器(decoder-only)Transformer 架构构建的。虽然灵活,但这些模型将安全审查视为文本生成任务,从而导致显著的延迟和成本。Pioneer AI 通过发布 GLiGuard,一款拥有 300M 参数的模型,证明了有效的安全审查并不需要数十亿参数。

解码器式护栏的瓶颈

大多数当前的护栏模型(如 LlamaGuard 或 ShieldGemma)采用自回归方式运行。它们一次生成一个 token 的安全判定,类似于标准 LLM 生成聊天回复的方式。这种方法主要有三大缺点:

  1. 顺序延迟: 由于生成是顺序进行的,它本质上比分类更慢。
  2. 计算成本: 参数规模在 7B 到 27B 之间的模型需要大量 GPU 资源,使得在生产环境中扩展成本高昂。
  3. 累积延迟: 安全审查通常需要检查多个维度(例如,这是否是 jailbreak?是否包含 PII?是否为仇恨言论?)。在解码器模型中,这些评估通常是逐个进行的,导致每增加一个安全标准就会累加延迟。

新方法:将审查重新定义为分类任务

GLiGuard 摒弃仅解码器的趋势,采用小型基于编码器的架构。它不再生成文本来描述安全状态,而是将审查重新定义为 文本分类问题

通过将输入文本与任务定义(标签)一起编码,模型能够在一次前向传播中同时为所有安全标签打分。这意味着评估五个不同的安全维度所需的时间与评估一个维度相同。

四个并行审查任务

GLiGuard 在一次前向传播中评估四个关键安全维度:

  • Safety Classification(安全分类): 对输入提示和输出响应进行二元检查(安全/不安全)。
  • Jailbreak Strategy Detection(越狱策略检测): 识别 11 种特定策略,包括提示注入、角色扮演绕过和社会工程等。任何检测到的策略都会自动将提示标记为不安全。
  • Harm Category Detection(危害类别检测): 在 14 类中进行分类,如暴力、色情内容、PII 泄露和版权侵权等。单个输入可能触发多个类别。
  • Refusal Detection(拒绝检测): 判断模型是遵从还是拒绝请求。这对于衡量“过度拒绝”(模型拒绝安全提示)以及检测“错误遵从”至关重要。

性能:准确性 vs. 效率

为验证 GLiGuard,Pioneer AI 将该模型与六个主要的基于解码器的护栏模型进行对比测试,包括 LlamaGuard4(12B)、ShieldGemma(27B)和 NemoGuard(8B)。

准确性基准

尽管体积比竞争对手小 23 到 90 倍,GLiGuard 的准确性仍可与当前 SOTA 相媲美:

  • Prompt Classification(提示分类): 平均 F1 分数为 87.7,仅比最佳模型(PolyGuard-Qwen)低 1.7 分。
  • Response Classification(响应分类): 平均 F1 为 82.7,仅次于 Qwen3Guard-8B。
  • Competitive Edge(竞争优势): 超过 LlamaGuard4-12B 和 ShieldGemma-27B,证明安全所需的分类能力可以在更紧凑的架构中实现。

速度与吞吐量

架构从解码器转向编码器模型,在单个 NVIDIA A100 GPU 上实现了显著的效率提升:

  • Throughput(吞吐量): 提升至最高 16.2 倍(批量大小 4 时为 133 vs. 8.2 样本/秒)。
  • Latency(延迟): 降低至最高 16.6 倍(序列长度 64 时为 26ms vs. 426ms)。

训练与部署

GLiGuard 使用混合的人类标注数据(通过 WildGuardTrain 数据集)和 GPT-4 生成的合成数据进行训练。为解决早期训练中对细粒度区分的困难——例如有害言论与暴力的区别——团队使用 Pioneer 生成了补充的合成边缘案例。

该模型通过对 GLiNER2-base-v1 检查点进行 20 个 epoch 的微调,使用 AdamW 优化器完成开发。

结论

对于构建具备代理能力的 AI 的开发者而言,安全护栏不是可选项,而是关键基础设施。然而,大型解码器模型的延迟惩罚常常在用户体验中造成摩擦点。GLiGuard 证明,通过从生成转向分类,开发者可以以极低的计算开销实现 SOTA 级别的安全审查。

GLiGuard 在 Hugging Face Hub 上以 Apache 2.0 许可证发布,为团队提供了一条实用的开源路径,能够部署高性能的安全层,而无需巨大的基础设施投入。

Sources