meta-llama/PurpleLlama
Set of tools to assess and improve LLM security.
解決的問題
Purple Llama 是一個旨在幫助社群以負責任的方式使用開源生成式 AI 模型的整合專案。它透過提供一系列工具與評估方法,解決與大語言模型(LLM)相關的風險,特別是網路安全威脅、惡意提示以及產生不安全程式碼的問題。
如何運作
該專案採用「紫隊」(purple teaming)方法,結合攻擊(紅隊)與防禦(藍隊)策略,以評估與緩解風險。它提供三大類工具:
- 系統級防護:包括 Llama Guard,一系列用於檢測違規內容的審核模型;Prompt Guard,用於防範提示注入與越獄攻擊;以及 Code Shield,在推理時過濾 LLM 產生的不安全程式碼。
- 評估與基準測試:CyberSec Eval 系列(v1、v2 和 v3)提供業界標準基準,用於量化網路安全風險、衡量程式碼解釋器被濫用的可能性,並測試視覺提示注入與魚叉式網路釣魚能力。
適用對象
需要為開源生成式 AI 模型部署信任、安全與防護層,以確保其應用安全並符合內容規範的開發者與研究人員。
主要亮點
- Llama Guard 3:高效率審核模型,支援多語言,具備 128k 上下文視窗,支援圖像推理。
- Prompt Guard:專門用於檢測並阻止提示注入與越獄嘗試的工具。
- Code Shield:在推理時進行過濾,防止不安全程式碼執行或程式碼解釋器被濫用。
- CyberSec Eval:基於業界標準(CWE 和 MITRE ATT&CK)的綜合性基準測試套件,用於評估 LLM 的網路安全風險。
相關
- 專案
- Dispatch
- 專案
- 專案
- Dispatch