Mistral AI Shieldstral 1.0 3B 发布

Mistral AI 推出了 Shieldstral,这是一个拥有 3B 参数的开源权重多模态安全分类器,旨在作为一种策略自适应的分类器。与使用固定伤害分类法的传统护栏模型不同,Shieldstral 允许用户在推理时将安全策略定义为自然语言问题,使其在文本安全方面的性能能够媲美规模大其七倍的模型,并在多模态审核方面树立了新的技术标杆。

通过二元问答实现策略自适应审核

Shieldstral 将内容审核视为一项二元问答任务。这种方法消除了在不同应用或受众之间更改安全定义时重新训练的需求。向模型的每个请求由三个部分组成:

  • <Instruct>: 定义评估上下文、严格程度以及对何为不安全内容的可选定义。
  • <Query>: 一个单一的“是/否”问题(例如,“此内容是否宣扬肢体暴力?”)。
  • <Document>: 被评估的内容,可以是一个提示词、一个回答、一个提示词-回答对,或者带有可选文本的图像。

通过仅读取 yesno 的 logits 并进行 softmax 归一化,模型会产生一个校准后的连续安全评分。这单一的接口将提示词分类、回答审核、拒绝检测和毒性检测统一到了一个问题中。

关键技术能力

Shieldstral 旨在实现跨多种模态的高效与灵活:

  • 多模态支持: 单一自然语言接口即可处理文本、图像以及文本-图像组合内容。
  • 硬件效率: 3B 模型能够在单个 16GB GPU 上运行。
  • 连续评分: 模型不提供离散标签,而是通过单次前向传播提供概率值,允许开发者根据置信度设置阈值或对结果进行排序。
  • 开源权重: 该模型根据 Apache 2.0 许可证发布。

训练方法论

Mistral AI 通过专注于数据质量和多样性来开发 Shieldstral,以克服 3B 参数模型的规模限制:

统一异构数据

为了处理来自公共安全数据集的冲突分类法和标签,Mistral AI 使用了针对每个数据集的处理器,将所有数据转换为一致的 instruction-query-document 格式。团队通过改变指令和查询的措辞来防止过拟合,并根据来源校准严格程度(例如,针对对抗性越狱采用严格模式,针对回答质量数据采用宽松模式)。

策略辨析

为了防止模型仅仅是记住固定的标签,团队使用了一个 LLM 来创建安全文本的对比对。这些对比对经过精心设计,使得重写后的文本会违反某项特定策略,但不会违反类似的“兄弟”策略,从而训练模型区分不同安全策略之间的精确边界。

多模态落地

由于视觉安全数据的稀缺,Mistral AI 使用通用图像数据集作为高质量的负样本来补充审核数据集。他们还使用了一个视觉-语言重排序器来过滤图像-查询对,以减少幻觉和标签错误的数据。

模型合并

Shieldstral 是通过使用 LoRA 进行微调并使用 SLERP 合并检查点(checkpoints)而创建的。最终模型结合了在公共数据上校准的检查点、专注于细粒度策略辨析的检查点,以及基础指令模型,以保持指令遵循能力。

开发基础设施

Shieldstral 是使用 Forge 构建的,Forge 是 Mistral AI 用于训练、对齐和评估自定义模型的平台。Forge 处理了基础设施、数据和模型分片以及日志记录,使研究团队能够专注于数据策划。

未来方向

Mistral AI 打算继续提高 Shieldstral 在多语言覆盖、长文档鲁棒性以及更广泛的多模态安全方面的能力。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch