Qwen3Guard 發布:LLM 的即時安全防護欄桿

Qwen 已發布 Qwen3Guard,這是 Qwen 生態系統中首個安全防護模型家族。該模型基於 Qwen3 基礎模型並針對安全分類進行微調,能精確偵測使用者提示與模型回應中的風險,並分配風險等級與分類,以促進精確的內容審核。

即時串流安全偵測

Qwen3Guard-Stream 讓在 token 生成過程中即可進行低延遲、即時的審核。不同於傳統防護模型在文本全部生成後才進行評估,Qwen3Guard-Stream 採用兩個輕量級分類頭,附加於 transformer 最終層。此架構使模型能在生成回應時逐 token 處理,於每一步即時輸出安全分類,確保安全性同時不犧牲回應速度。

模型變體與部署選項

Qwen3Guard 提供兩種專門變體,且每種變體都有 0.6B、4B、8B 參數規模,以因應不同資源限制:

  • Qwen3Guard-Gen:一個生成式模型,設計用於接受完整的使用者提示與模型回應。它針對離線安全標註、資料集過濾,以及為強化學習(RL)提供基於安全的獎勵進行了最佳化。
  • Qwen3Guard-Stream:一個專門用於在主動回應生成過程中即時串流安全偵測的模型。

三層級嚴重性分類

為提供較二元「安全」或「不安全」標籤更大的彈性,Qwen3Guard 引入 Controversial(具爭議)標籤。此三層級系統讓開發者能根據特定使用情境實施動態安全政策:

  • Strict Mode(嚴格模式):具爭議的情況可重新分類為不安全。
  • Loose Mode(寬鬆模式):具爭議的情況可重新分類為安全。

此設計使 Qwen3Guard 能在不同資料集標準下保持穩健表現,而這些標準在二元標籤限制下往往會產生衝突。

多語言支援與全球覆蓋

Qwen3Guard 支援 119 種語言與方言,確保在多樣的語言環境中提供一致的安全表現。支援的語言族群包括:

  • Indo-European(印歐語系):包括英語、西班牙語、法語、德語、俄語、印地語與孟加拉語。
  • Sino-Tibetan(漢藏語系):包括簡體中文、繁體中文、粵語與緬甸語。
  • Afro-Asiatic(亞非語系):包括各種阿拉伯語方言與希伯來語。
  • Austronesian(南島語系):包括印尼語、馬來語與他加祿語。
  • Dravidian(達羅毗荼語系):包括泰米爾語、泰盧語、坎那達語與馬拉雅拉姆語。
  • Turkic(土耳其語系):包括土耳其語、哈薩克語與烏茲別克語。
  • Tai-Kadai(台-卡岱語系):泰語與老撾語。
  • Uralic(烏拉爾語系):芬蘭語、愛沙尼亞語與匈牙利語。
  • Austroasiatic(南亞語系):越南語與高棉語。
  • Other(其他):包括日語、韓語、格魯吉亞語與斯瓦希里語。

技術實作與應用

Qwen3Guard-Gen 工作流程

Qwen3Guard-Gen 使用針對安全分類優化的聊天模板。它產生結構化輸出,標示安全標籤(Safe、Unsafe 或 Controversial)以及具體風險類別(例如暴力、個人資訊、性內容或版權侵害)。在回應審核時,它亦會辨識模型是否給予拒絕。

Qwen3Guard-Stream 工作流程

Qwen3Guard-Stream 以兩階段流程運作:

  1. Prompt-Level Check(提示層檢查):立即評估使用者的輸入。若提示被判定為不安全,系統可在 LLM 開始生成回應前中止對話。
  2. Token-Level Moderation(Token 層審核):若對話繼續,LLM 產生的每個 token 會即時傳送至 Qwen3Guard-Stream,從而在整個生成過程中動態降低風險。

進階使用案例

除了直接審核之外,Qwen3Guard 亦用於:

  • Safety RL(安全強化學習):使用 Qwen3Guard-Gen 提升模型安全性,同時保持實用性。
  • 即時介入:使用 Qwen3Guard-Stream 確保輸出安全,無需重新訓練底層模型。

Sources