AprielGuard:現代大型語言模型系統的安全與對抗魯棒性護欄

Hugging Face 與 ServiceNow AI 推出了 AprielGuard,一款 8 億參數的防護模型,旨在偵測 16 種安全風險類別以及各種對抗攻擊。此統一模型透過支援多輪對話、長上下文與複雜的代理工作流程,克服傳統安全分類器的限制,減少對脆弱且碎片化護欄系統的需求。

統一的安全與對抗偵測

AprielGuard 提供單一介面,同時執行安全風險分類與對抗攻擊偵測。它支援三種主要的輸入格式:單獨提示、多輪對話與代理工作流程(包括工具呼叫、推理痕跡、記憶與系統上下文)。

安全分類法

受 SALAD-Bench 啟發,模型將安全風險分為 16 個不同類別:

  • O1-O3:有害內容、不公平呈現、成人內容
  • O4-O5:削弱公眾資訊信任、散布誤解/錯誤信念
  • O6-O8:高風險金融行為、貿易與合規、散布危險資訊
  • O9-O11:侵犯隱私、安全威脅、誹謗
  • O12-O14:詐騙或欺騙行為、影響作業、非法活動
  • O15-O16:說服與操控、侵犯個人財產

對抗攻擊偵測

AprielGuard 偵測廣泛的對抗模式,旨在規避安全機制,包括提示注入、越獄、思考鏈破壞、上下文劫持、記憶中毒以及多代理利用序列。模型對這些威脅提供二元分類(對抗 vs. 非對抗)。

技術架構與訓練

AprielGuard 基於 Apriel-1.5 Thinker Base 變體的 8 億參數縮減版,採用因果僅解碼器 Transformer 架構。

雙模式運作

為在延遲與可解釋性之間取得平衡,模型提供兩種模式:

  • Reasoning Mode(推理模式):產生結構化說明以解釋其分類決策,提供可解釋性。
  • Fast Mode(快速模式):僅提供分類結果,以符合低延遲的生產管線需求。

訓練方法論

模型以 bfloat16 精度訓練 3 個 epoch,序列長度最高達 32k 令牌。訓練資料集由多個專門來源構成:

  • Synthetic Data(合成資料):使用 Mixtral-8x7B 與未審查模型產生,搭配 SyGra 框架與 NVIDIA NeMo Curator 生成多輪對話資料集。
  • Data Augmentation(資料增強):加入字元層級噪聲、打字錯誤、leet 語言與句法重排,以提升對非標準文字的韌性。
  • Agentic Workflows(代理工作流程):模擬包含規劃、工具呼叫與執行痕跡的情境,對特定片段(如工具輸出或記憶狀態)進行破壞,以模擬攻擊向量。
  • Long Context(長上下文):專門資料集包含 RAG 工作流程與作業報告,用於測試在 32k 令牌內的「大海撈針」風險偵測。

效能與評估

AprielGuard 在公共基準、內部代理基準與多語言資料集上進行評估。

安全與對抗基準

在公共安全基準上,模型於 HarmBench(1.00)、SimpleSafetyTests(0.98)與 XSTest(0.94)等資料集取得高 F1 分數。對於對抗偵測,於 ChatGPT-Jailbreak-Prompts(1.00 F1)與 Salad-Data(0.98 F1)表現強勁,然而在特定提示注入基準如 prompt-injections(0.68 F1)上表現有所差異。

長上下文與多語言韌性

在長上下文評估(最高 32k 令牌)中,AprielGuard 維持高精確率與召回率。安全風險方面,非推理模式的 F1 為 0.97,推理模式為 0.95。對抗攻擊方面,推理模式將 F1 提升至 0.94,較非推理模式的 0.88 有明顯改善。

多語言能力在八種語言(法語、法語(加拿大)、德語、日語、荷蘭語、西班牙語、巴西葡萄牙語與義大利語)上進行測試,使用 MADLAD400-3B-MT 模型的翻譯,顯示在這些語言環境中具備合理的表現。

限制與部署考量

雖然 AprielGuard 提供統一的防護,但開發者指出若干限制:

  • Domain Sensitivity(領域敏感度):模型在法律或醫療等高度專業的技術領域可能表現不佳。
  • Latency Trade-off(延遲權衡):推理模式會提升計算成本與延遲。
  • Consistency(一致性):在啟用推理與非推理模式之間,分類結果偶爾會出現不一致。
  • Language Coverage(語言覆蓋):雖已在八種非英語語言上測試,仍建議在非英語環境的正式部署前進行徹底校準。

Sources