Qwen3Guard 发布:面向 LLM 的实时安全防护栏
Qwen 已发布 Qwen3Guard,这是 Qwen 生态系统中首个安全防护模型系列。该模型基于 Qwen3 基础模型并经过安全分类微调,能够精准检测用户提示和模型响应中的风险,分配风险等级并进行分类,以便实现准确的内容审核。
实时流式安全检测
Qwen3Guard-Stream 实现了低延迟、即时的审核,可在 token 生成过程中进行。不同于传统防护模型在文本全部生成后再进行评估,Qwen3Guard-Stream 使用了附加在 transformer 最后一层的两个轻量分类头。该架构使模型能够在生成响应时逐 token 处理,并在每一步即时输出安全分类,从而在不牺牲响应速度的前提下确保安全。
模型变体和部署选项
Qwen3Guard 提供两种专用变体,每种变体均有 0.6B、4B、8B 参数规模,以适应不同的资源限制:
- Qwen3Guard-Gen:一种生成模型,旨在接受完整的用户提示和模型响应。它针对离线安全标注、数据集过滤以及为强化学习(RL)提供基于安全的奖励进行优化。
- Qwen3Guard-Stream:一种专用于在主动响应生成期间进行实时流式安全检测的模型。
三级严重性分类
为提供比二元 “安全” 或 “不安全” 标签更大的灵活性,Qwen3Guard 引入了 Controversial(有争议)标签。该三级系统使开发者能够根据具体使用场景实现动态安全策略:
- 严格模式:有争议的实例可重新归类为不安全。
- 宽松模式:有争议的实例可重新归类为安全。
该设计使 Qwen3Guard 能在不同数据集标准之间保持稳健性能,而这些标准在二元标签约束下往往会产生冲突。
多语言支持与全球覆盖
Qwen3Guard 支持 119 种语言和方言,确保在多样的语言环境中保持一致的安全性能。支持的语言族包括:
- 印欧语系:包括英语、西班牙语、法语、德语、俄语、印地语和孟加拉语。
- 汉藏语系:包括简体中文、繁体中文、粤语和缅甸语。
- 亚非语系:包括各种阿拉伯语方言和希伯来语。
- 南岛语系:包括印尼语、马来语和塔加路语。
- 达罗毗荼语系:包括泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语。
- 突厥语系:包括土耳其语、哈萨克语和乌兹别克语。
- 台-卡岱语系:泰语和老挝语。
- 乌拉尔语系:芬兰语、爱沙尼亚语和匈牙利语。
- 南亚语系:越南语和高棉语。
- 其他:包括日语、韩语、格鲁吉亚语和斯瓦希里语。
技术实现与应用
Qwen3Guard-Gen 工作流
Qwen3Guard-Gen 使用针对安全分类优化的聊天模板。它生成结构化输出,标识安全标签(安全、不安全或有争议)以及具体风险类别(例如暴力、个人身份信息、性内容或版权侵权)。在响应审核时,它还会判断模型是否给出拒绝。
Qwen3Guard-Stream 工作流
Qwen3Guard-Stream 采用两阶段流程:
- 提示级检查:用户输入会被立即评估。如果提示被判定为不安全,系统可在 LLM 开始生成响应前中止对话。
- Token 级审核:如果对话继续进行,LLM 生成的每个 token 将实时传递给 Qwen3Guard-Stream,以在整个生成过程中实现动态风险缓解。
高级用例
除直接审核外,Qwen3Guard 还用于:
- 安全强化学习:使用 Qwen3Guard-Gen 在保持模型有用性的同时提升安全性。
- 即时干预:使用 Qwen3Guard-Stream 确保安全输出,无需对底层模型进行重新训练。