NVIDIA Nemotron 3.5 内容安全发布

NVIDIA Nemotron 3.5 内容安全发布

TL;DR

NVIDIA 发布了 Nemotron 3.5 Content Safety,这是一个拥有 4B 参数的单一模型,通过单次推理调用即可统一多模态输入、多语言覆盖、自定义企业策略执行以及可审计的推理过程。

统一的多模态评估

Nemotron 3.5 将用户提示词、可选图像和可选助手响应作为一个单一的上下文窗口进行评估,从而针对组合输入生成连贯的安全判定。这种联合评估弥补了当策略违规仅在文本与图像之间、或请求与响应之间产生时,独立对每种模态进行评分所遗漏的空白。

全球语言覆盖

Nemotron 3.5 保留了对十二种语言的显式训练——英语、法语、西班牙语、德语、中文、日语、韩语、阿拉伯语、印地语、俄语、葡萄牙语和意大利语——同时继承了来自 Gemma 3 基础模型的约 140 种额外语言的零样本泛化能力。在低资源市场的部署将受益于这种迁移,无需进行单独的微调。

自定义策略执行

该模型在接收输入的同时接受自定义策略规范,并在生成判定时对该策略进行推理,而不是仅仅依赖内置的分类体系。这使得企业能够抑制无关类别、注入专有的风险类别,并使安全行为适应特定领域的规则,例如医疗、金融或儿童应用。

推理轨迹 (THINK 模式)

当启用 THINK 模式时,Nemotron 3.5 在交付最终的 safe/unsafe 标签和可选的违规类别之前,会输出逐步的推理轨迹。推理轨迹的示例格式为:

[step-by-step reasoning trace]

User Safety: unsafe
Response Safety: unsafe
Safety Categories: Criminal Planning/Confessions, Controlled Substances

如果延迟至关重要,可以禁用 THINK 模式,以返回与 Nemotron 3 相同的低延迟二元判定。

安全数据集

NVIDIA 正在发布 Nemotron 3.5 Content Safety 数据集,该数据集是多模态、多语言的,并包含了用于训练模型的安全推理轨迹。该数据集结合了真实照片多模态数据、多语言文本安全数据、安全的 VLM 数据、源自大型教师模型的推理轨迹、遵循主题的数据,以及少量用于增加越狱多样性的合成数据。

模型架构

Nemotron 3.5 Content Safety 基于 Google Gemma 3 4B IT (4B 参数) 构建,具有 128K 上下文窗口、强大的视觉语言推理能力和广泛的多语言覆盖能力。通过 LoRA adapter 对基础模型进行微调,以安装针对性的安全分类行为,同时保持模型紧凑,以便在 8GB+ VRAM 的 GPU 上进行实时部署。该模型支持三种输出模式:低延迟二元判定、带类别的二元判定,以及 THINK 模式(推理 + 判定)。

推理

推理为生产级 AI 系统提供了所需的上下文、定制化和问责制,尤其是在受监管的环境中。它实现了对自定义策略的动态解释,为合规日志记录和人工审核提供了可审计的依据,并揭示了边缘情况的解释以辅助策略迭代。将推理轨迹压缩为简洁的摘要可以限制输出 token 并保持效率,这是从 Nemotron Content Safety Reasoning 4B 模型继承的技术。

延迟

在默认(无 THINK)模式下,延迟与 Nemotron 3 保持一致。启用 THINK 模式会增加与轨迹长度成正比的推理时间,但这种开销是可预测的,并且可以单独预算——例如,通过在审计流水线中异步运行 THINK 模式评估,同时由默认模式处理实时决策。与另一种多模态安全模型相比,Nemotron 3.5 在多模态基准测试中实现了 3 倍的端到端延迟降低,并且在启用推理时生成的 token 最多减少 50%。

解决基准测试差距

现有的多模态安全基准测试存在仅覆盖文本、依赖缺乏现实纹理的合成图像(通常是 SDXL)以及限制重新分发真实照片的许可限制等问题。这些差距意味着基准测试结果可能无法反映生产环境的难度。NVIDIA 的训练数据使用真实图像和具有文化细微差别的多语言提示词来缓解模型训练中的部分差距,但评估差距对于更广泛的安全研究界来说仍是一个开放性问题。

开始使用

Nemotron 3.5 Content Safety 已在 Hugging Face 上发布,根据 NVIDIA Open Model License 提供研究和商业用途,并附带训练数据集。它支持 Transformers、vLLM 和 SGLang,并作为生产级 NVIDIA NIM (nvcr.io/nim/nvidia/nemotron-3.5-content-safety:2.0.5-variant) 提供在 build.nvidia.com 上。该模型还可以通过包括 Baseten、Eigen AI、DeepInfra、OpenRouter 和 Vultr 在内的推理平台进行访问。对于自定义策略工作流,NVIDIA 提供了一个与 Claude 和 Codex 兼容的技能用于生成自定义策略,以及展示如何使用该模型的指南。

Sources