AprielGuard:现代大型语言模型系统中的安全与对抗鲁棒性护栏

Hugging Face 和 ServiceNow AI 推出了 AprielGuard,这是一款拥有 8B 参数的安全防护模型,旨在检测 16 类安全风险以及广泛的对抗攻击。该统一模型通过支持多轮对话、长上下文和复杂的代理工作流,克服了传统安全分类器的局限,降低了对脆弱、碎片化护栏系统的需求。

统一的安全与对抗检测

AprielGuard 为安全风险分类和对抗攻击检测提供了单一接口。它支持三种主要输入形式:单独提示、多轮对话以及代理工作流(包括工具调用、推理轨迹、记忆和系统上下文)。

安全分类

受 SALAD-Bench 启发,模型将安全风险划分为 16 个不同的类别:

  • O1-O3:有害内容、不公平表述、成人内容
  • O4-O5:削弱公众信息信任、传播误解/错误信念
  • O6-O8:高风险金融行为、贸易与合规、传播危险信息
  • O9-O11:侵犯隐私、安全威胁、诽谤
  • O12-O14:欺诈或欺骗行为、影响行动、非法活动
  • O15-O16:劝诱与操纵、侵犯个人财产

对抗攻击检测

AprielGuard 能检测旨在规避安全机制的广谱对抗模式,包括提示注入、越狱、思路链破坏、上下文劫持、记忆投毒以及多代理利用序列。模型对这些威胁提供二元分类(对抗 vs. 非对抗)。

技术架构与训练

AprielGuard 基于 Apriel-1.5 Thinker Base 变体的下采样 8B 参数版本,采用因果解码器‑only Transformer 架构。

双模式运行

为在延迟与可解释性之间取得平衡,模型提供两种模式:

  • 推理模式:为其分类决策生成结构化解释,提供可解释性。
  • 快速模式:仅提供分类结果,以满足低延迟生产流水线。

训练方法

模型使用 bfloat16 精度,在最长 32k token 的序列长度下训练了 3 个 epoch。训练数据集由多个专门来源构建:

  • 合成数据:使用 Mixtral-8x7B 和未审查模型生成,结合 SyGra 框架和 NVIDIA NeMo Curator 构建多轮对话数据集。
  • 数据增强:加入字符级噪声、拼写错误、网络语言(leet)以及句法重排,以提升对非标准文本的鲁棒性。
  • 代理工作流:模拟包括规划、工具调用和执行轨迹的场景,对特定片段(如工具输出或记忆状态)进行破坏,以模拟攻击向量。
  • 长上下文:使用包括 RAG 工作流和运营报告的专门数据集,测试在最长 32k token 的“针孔搜索”风险检测。

性能与评估

AprielGuard 在公共基准、内部代理基准以及多语言数据集上进行了评估。

安全与对抗基准

在公共安全基准上,模型在 HarmBench(1.00)、SimpleSafetyTests(0.98)和 XSTest(0.94)等数据集上取得了高 F1 分数。对抗检测方面,模型在 ChatGPT-Jailbreak-Prompts(1.00 F1)和 Salad-Data(0.98 F1)上表现强劲,但在特定提示注入基准(如 prompt-injections,0.68 F1)上的表现有所波动。

长上下文与多语言鲁棒性

在长上下文评估(最高 32k token)中,AprielGuard 保持了高精度和召回率。针对安全风险,非推理模式的 F1 为 0.97,推理模式为 0.95。针对对抗攻击,推理模式将 F1 提升至 0.94,而非推理模式为 0.88。

多语言能力在八种语言(法语、法语‑加拿大、德语、日语、荷兰语、西班牙语、巴西葡萄牙语和意大利语)上使用 MADLAD400-3B-MT 模型的翻译进行测试,显示出在这些语言环境下的合理性能。

限制与部署注意事项

虽然 AprielGuard 提供了统一的防护,但开发者指出了若干限制:

  • 领域敏感性:模型在法律或医学等高度专业化技术领域可能表现不佳。
  • 延迟权衡:推理模式会增加计算成本和延迟。
  • 一致性:在启用推理模式和非推理模式之间,分类结果偶尔会出现不一致。
  • 语言覆盖:虽然已在八种非英语语言上进行测试,但在非英语环境的生产部署前建议进行充分校准。

Sources