GLiGuard:以高效能小型語言模型擴展 AI 安全性

隨著 AI 代理人從簡單的聊天機器人轉變為能夠瀏覽網路與執行程式碼的自主實體,LLM 部署的風險概況已發生變化。關注的焦點不再僅是冒犯性文字,而是防止現實世界的傷害。為了減輕這些風險,開發者依賴護欄——位於使用者與模型之間的安全層,用以過濾惡意提示與有害回應。

歷史上,最先進(SOTA)的護欄模型多建立於大型僅解碼器(decoder‑only)變換器架構上。雖具彈性,這些模型將安全審核視為文字生成任務,導致顯著的延遲與成本。Pioneer AI 透過發布 GLiGuard,一款 3 億參數的模型,證明有效的安全審核並不需要數十億參數,從而解決了此一低效問題。

解碼器式護欄的瓶頸

大多數現行護欄模型(如 LlamaGuard 或 ShieldGemma)以自回歸方式運作。它們一次產生一個 token 的安全判定,類似標準 LLM 產生聊天回應的方式。此方法有三大主要缺點:

  1. Sequential Latency(順序延遲): 由於生成是順序進行的,天然比分類慢。
  2. Computational Cost(計算成本): 參數介於 7B 至 27B 的模型需要大量 GPU 資源,使得在生產環境中擴展成本高昂。
  3. Compounding Delay(累積延遲): 安全審核常需檢查多個維度(例如,這是破解嗎?是否有個人資訊?是否為仇恨言論?)。在解碼器模型中,這些評估通常逐一執行,導致每新增一項安全標準都會累積延遲。

新方法:將審核重新構築為分類

GLiGuard 以小型編碼器架構脫離僅解碼器的潮流。它不再產生文字回應來描述安全狀態,而是將審核重新構築為 文字分類問題

透過同時編碼輸入文字與任務定義(標籤),模型能在一次前向傳播中同時為所有安全標籤打分。這意味著評估五個不同的安全維度所需時間與評估單一維度相同。

四項同步審核任務

GLiGuard 在一次傳遞中評估四個關鍵安全維度:

  • Safety Classification(安全分類): 對輸入提示與輸出回應皆執行二元檢查(安全/不安全)。
  • Jailbreak Strategy Detection(破解策略偵測): 辨識 11 種特定策略,包含提示注入、角色扮演繞過與社交工程。任何偵測到的策略皆會自動將提示標記為不安全。
  • Harm Category Detection(危害類別偵測): 在 14 個類別(如暴力、性內容、個人資訊洩露、版權侵害)中進行分類。單一輸入可能觸發多個類別。
  • Refusal Detection(拒絕偵測): 判斷模型是遵從還是拒絕請求。此項對於衡量「過度拒絕」(模型拒絕安全提示)與偵測「偽遵從」至關重要。

效能:準確度 vs. 效率

為驗證 GLiGuard,Pioneer AI 將該模型與六個主要的解碼器式護欄模型進行測試,包含 LlamaGuard4(12B)、ShieldGemma(27B)與 NemoGuard(8B)。

準確度基準

儘管尺寸比競爭對手小 23 至 90 倍,GLiGuard 的準確度仍與當前 SOTA 相當:

  • Prompt Classification(提示分類): 平均 F1 分數為 87.7,僅比最佳模型(PolyGuard-Qwen)低 1.7 分。
  • Response Classification(回應分類): 平均 F1 為 82.7,僅次於 Qwen3Guard-8B。
  • Competitive Edge(競爭優勢): 超過 LlamaGuard4-12B 與 ShieldGemma-27B,證明安全所需的分類能力可在更緊湊的架構中實現。

速度與吞吐量

從架構轉向編碼器模型在單顆 NVIDIA A100 GPU 上帶來顯著的效率提升:

  • Throughput(吞吐量): 提升至最高 16.2 倍(批次大小 4 時,133 vs. 8.2 個樣本/秒)。
  • Latency(延遲): 降低至最高 16.6 倍(序列長度 64 時,26ms vs. 426ms)。

訓練與部署

GLiGuard 使用混合的人類標註資料(透過 WildGuardTrain 資料集)與 GPT-4 產生的合成資料進行訓練。為解決早期訓練中對細微差異(如有毒言論與暴力之間的區別)的困難,團隊利用 Pioneer 產生補充的合成邊緣案例。

模型透過對 GLiNER2-base-v1 檢查點進行 20 個 epoch 的微調,使用 AdamW 優化器開發完成。

結論

對於開發具代理能力的 AI 的開發者而言,護欄不是可有可無的,而是關鍵基礎設施。然而,大型解碼器模型的延遲懲罰常成為使用者體驗的摩擦點。GLiGuard 證明,透過從生成轉為分類,開發者可以極低的計算開銷達到 SOTA 水準的安全審核。

GLiGuard 以 Apache 2.0 授權於 Hugging Face Hub 上發布,為團隊提供實用的開源方案,讓他們在不需龐大基礎建設投資的情況下部署高效能的安全層。

Sources