NVIDIA Nemotron 3.5 內容安全發佈

NVIDIA Nemotron 3.5 內容安全發佈

TL;DR

NVIDIA 宣布推出 Nemotron 3.5 Content Safety,這是一個單一 4B 參數模型,在單次推論呼叫中統一了多模態輸入、多語言覆蓋、自定義企業策略執行以及可審核的推理能力。

統一的多模態評估

Nemotron 3.5 將使用者提示詞、選用的圖像以及選用的助手回應共同視為單一上下文窗口進行評估,從而針對組合輸入產生連貫的安全判定。這項聯合評估彌補了當政策違規僅出現在文本與圖像之間,或請求與回應之間的互動時,獨立對各個模態進行評分所會遺漏的缺口。

全球語言覆蓋

Nemotron 3.5 保留了對十二種語言的顯式訓練——英語、法語、西班牙語、德語、中文、日語、韓語、阿拉伯語、印地語、俄語、葡萄牙語和義大利語——同時繼承了來自 Gemma 3 基礎模型的約 140 種額外語言的零樣本(zero-shot)泛化能力。在低資源市場的部署將受益於這種遷移,無需進行單獨的微調。

自定義策略執行

該模型在輸入時接受自定義的策略規範,並在產生判定時對該策略進行推理,而不是僅依賴內建的分類法。這使得企業能夠抑制無關的類別、注入專有的風險類別,並根據特定領域的規則(如醫療、金融或兒童應用程式)調整安全行為。

推理軌跡 (THINK 模式)

啟用 THINK 模式時,Nemotron 3.5 在交付最終的安全/不安全標籤及選用的違規類別之前,會輸出逐步的推理軌跡。一個範例軌跡格式如下:

[step-by-step reasoning trace]

User Safety: unsafe
Response Safety: unsafe
Safety Categories: Criminal Planning/Confessions, Controlled Substances

如果延遲至關重要,可以禁用 THINK 模式,以返回與 Nemotron 3 相同的低延遲二元判定。

安全數據集

NVIDIA 正在發佈 Nemotron 3.5 Content Safety Dataset,該數據集是多模態、多語言的,並包含了用於訓練模型的安全推理軌跡。該數據集結合了真實照片多模態數據、多語言文本安全數據、安全的 VLM 數據、源自大型教師模型的推理軌跡、主題遵循數據,以及少量用於增加越獄(jailbreak)多樣性的合成數據。

模型架構

Nemotron 3.5 Content Safety 基於 Google Gemma 3 4B IT (4B 參數) 構建,具有 128K 上下文窗口、強大的視覺語言推理能力和廣泛的多語言覆蓋。透過 LoRA adapter 對基礎模型進行微調,以安裝目標安全分類行為,同時保持模型輕量化,以便在 8GB+ VRAM 的 GPU 上進行即時部署。該模型支持三種輸出模式:低延遲二元判定、帶有類別的二元判定,以及 THINK 模式(推理 + 判定)。

推理

推理為生產級 AI 系統提供了所需的上下文、自定義能力和問責制,特別是在受監管的環境中。它實現了對自定義策略的動態解釋,為合規日誌記錄和人工審核提供了可審核的理由,並揭示了邊緣案例的解釋以供政策迭代參考。將推理軌跡壓縮成簡潔的摘要可以限制輸出 token 並保持效率,這是從 Nemotron Content Safety Reasoning 4B 模型繼承而來的技術。

延遲

在預設(無 THINK)模式下,延遲與 Nemotron 3 相比沒有變化。啟用 THINK 模式會增加與軌跡長度成正比的推論時間,但這種開銷是可預測的,可以單獨編列預算——例如,在審計流水線中異步運行 THINK 模式評估,同時由預設模式處理即時決策。與另一種多模態安全模型相比,Nemotron 3.5 在多模態基準測試中實現了低 3 倍的端到端延遲,並在啟用推理時減少了高達 50% 的 token 產生。

解決基準測試缺口

現有的多模態安全基準測試存在僅限文本覆蓋、依賴缺乏現實世界質感的合成圖像(通常是 SDXL),以及防止重新分發真實照片的授權限制等問題。這些缺口意味著基準測試結果可能無法反映實際生產中的難度。NVIDIA 的訓練數據使用真實圖像和具有文化細微差別的多語言提示詞來緩解模型訓練中的部分缺口,但評估缺口仍是廣泛安全研究領域的一個開放問題。

開始使用

Nemotron 3.5 Content Safety 已在 Hugging Face 上根據 NVIDIA Open Model License 提供,可用於研究和商業用途,並附帶訓練數據集。它支持 Transformers、vLLM 和 SGLang,並作為生產級 NVIDIA NIM (nvcr.io/nim/nvidia/nemotron-3.5-content-safety:2.0.5-variant) 提供於 build.nvidia.com。該模型也可以透過包括 Baseten、Eigen AI、DeepInfra、OpenRouter 和 Vultr 在內的推論平台進行訪問。對於自定義策略工作流,NVIDIA 提供了一個與 Claude 和 Codex 相容的技能來生成自定義策略,以及展示如何使用該模型的食譜(cookbooks)。

Sources