Llama Guard 4 與 Llama Prompt Guard 2 發布

Meta 已發布 Llama Guard 4,一個 12B 多模態安全模型,以及 Llama Prompt Guard 2,一系列旨在偵測提示注入與越獄的分類器。這些工具讓開發者能夠過濾使用者輸入與模型輸出,以防止在生產環境中產生不安全的內容。

Llama Guard 4:多模態安全審核

Llama Guard 4 是一個密集的 12B 參數模型,旨在偵測文字與圖像中的不當內容。它可在具備 24 GB 顯存的單一 GPU 上部署,成為生產審核流程的實用選擇。該模型能夠評估純文字以及圖文結合的輸入,讓它在提示送達主要大型語言模型前進行過濾,並在助理回應傳遞給使用者前進行審查。

技術架構與訓練

Llama Guard 4 採用密集前饋早期融合架構。它是透過裁剪 Llama 4 Scout 模型(使用混合專家(MoE)架構)而產生的。Meta 移除所有路由專家與路由層,僅保留共享專家,從預訓練的共享專家權重初始化,無需額外的預訓練,即完成密集模型的開發。

Llama Guard 4 的訓練資料以 3:1 的比例混合純文字與多模態資料,包含多圖像訓練資料(最多 5 張圖像)以及先前用於 Llama Guard 3 的人工標註多語言資料。

危害分類與客製化

Llama Guard 4 依據 MLCommons 危害分類法所定義的 14 種危害類型,外加程式碼解譯器濫用,對內容進行分類。支援的類別包括:

  • S1:暴力犯罪
  • S2:非暴力犯罪
  • S3:性相關犯罪
  • S4:兒童性剝削
  • S5:誹謗
  • S6:專業建議
  • S7:隱私
  • S8:智慧財產權
  • S9:無差別武器
  • S10:仇恨
  • S11:自殺與自我傷害
  • S12:性內容
  • S13:選舉
  • S14:程式碼解譯器濫用(僅文字)

使用者可在推論時透過聊天模板排除特定類別鍵(例如 excluded_category_keys=["S9", "S2", "S1"])來設定偵測的類別清單。

效能基準

相較於 Llama Guard 3,Llama Guard 4 在多個領域都有提升,尤其在多圖像與英文文字的效能上:

類別 召回率 偽陽性率 F1 分數 Δ 召回率 Δ 偽陽性率 Δ F1 分數
英文 69% 11% 61% +4% -3% +8%
多語言 43% 3% 51% -2% -1% 0%
單圖像 41% 9% 38% +10% 0% +8%
多圖像 61% 9% 52% +20% -1% +17%

Llama Prompt Guard 2:注入與越獄偵測

Llama Prompt Guard 2 由兩個新分類器組成,分別為 86M 與 22M 參數。這些模型專注於偵測提示注入與越獄。

相較於 Llama Prompt Guard 1 的主要改進包括:

  • 提升效能:偵測能力提升。
  • 效率:全新、更快且更緊湊的 22M 參數模型。
  • 韌性:更能抵禦對抗性攻擊的斷詞方式。
  • 簡化分類:二元分類系統(良性 vs. 惡意)。

實作與部署

要使用這些模型,使用者必須安裝 hf_xet 以及 transformers 函式庫的預覽版(v4.51.3-LlamaGuard-preview)。

Llama Guard 4 可透過 Llama4ForConditionalGenerationAutoProcessor 來實作,而 Llama Prompt Guard 2 則可透過 Hugging Face 的 pipeline API 或 AutoModelForSequenceClassification API 部署。

Sources