Llama Guard 4 與 Llama Prompt Guard 2 發布
Meta 已發布 Llama Guard 4,一個 12B 多模態安全模型,以及 Llama Prompt Guard 2,一系列旨在偵測提示注入與越獄的分類器。這些工具讓開發者能夠過濾使用者輸入與模型輸出,以防止在生產環境中產生不安全的內容。
Llama Guard 4:多模態安全審核
Llama Guard 4 是一個密集的 12B 參數模型,旨在偵測文字與圖像中的不當內容。它可在具備 24 GB 顯存的單一 GPU 上部署,成為生產審核流程的實用選擇。該模型能夠評估純文字以及圖文結合的輸入,讓它在提示送達主要大型語言模型前進行過濾,並在助理回應傳遞給使用者前進行審查。
技術架構與訓練
Llama Guard 4 採用密集前饋早期融合架構。它是透過裁剪 Llama 4 Scout 模型(使用混合專家(MoE)架構)而產生的。Meta 移除所有路由專家與路由層,僅保留共享專家,從預訓練的共享專家權重初始化,無需額外的預訓練,即完成密集模型的開發。
Llama Guard 4 的訓練資料以 3:1 的比例混合純文字與多模態資料,包含多圖像訓練資料(最多 5 張圖像)以及先前用於 Llama Guard 3 的人工標註多語言資料。
危害分類與客製化
Llama Guard 4 依據 MLCommons 危害分類法所定義的 14 種危害類型,外加程式碼解譯器濫用,對內容進行分類。支援的類別包括:
- S1:暴力犯罪
- S2:非暴力犯罪
- S3:性相關犯罪
- S4:兒童性剝削
- S5:誹謗
- S6:專業建議
- S7:隱私
- S8:智慧財產權
- S9:無差別武器
- S10:仇恨
- S11:自殺與自我傷害
- S12:性內容
- S13:選舉
- S14:程式碼解譯器濫用(僅文字)
使用者可在推論時透過聊天模板排除特定類別鍵(例如 excluded_category_keys=["S9", "S2", "S1"])來設定偵測的類別清單。
效能基準
相較於 Llama Guard 3,Llama Guard 4 在多個領域都有提升,尤其在多圖像與英文文字的效能上:
| 類別 | 召回率 | 偽陽性率 | F1 分數 | Δ 召回率 | Δ 偽陽性率 | Δ F1 分數 |
|---|---|---|---|---|---|---|
| 英文 | 69% | 11% | 61% | +4% | -3% | +8% |
| 多語言 | 43% | 3% | 51% | -2% | -1% | 0% |
| 單圖像 | 41% | 9% | 38% | +10% | 0% | +8% |
| 多圖像 | 61% | 9% | 52% | +20% | -1% | +17% |
Llama Prompt Guard 2:注入與越獄偵測
Llama Prompt Guard 2 由兩個新分類器組成,分別為 86M 與 22M 參數。這些模型專注於偵測提示注入與越獄。
相較於 Llama Prompt Guard 1 的主要改進包括:
- 提升效能:偵測能力提升。
- 效率:全新、更快且更緊湊的 22M 參數模型。
- 韌性:更能抵禦對抗性攻擊的斷詞方式。
- 簡化分類:二元分類系統(良性 vs. 惡意)。
實作與部署
要使用這些模型,使用者必須安裝 hf_xet 以及 transformers 函式庫的預覽版(v4.51.3-LlamaGuard-preview)。
Llama Guard 4 可透過 Llama4ForConditionalGeneration 與 AutoProcessor 來實作,而 Llama Prompt Guard 2 則可透過 Hugging Face 的 pipeline API 或 AutoModelForSequenceClassification API 部署。