meta-llama/PurpleLlama

Set of tools to assess and improve LLM security.

解決的問題

Purple Llama 是一個旨在幫助社群以負責任的方式使用開源生成式 AI 模型的整合專案。它透過提供一系列工具與評估方法,解決與大語言模型(LLM)相關的風險,特別是網路安全威脅、惡意提示以及產生不安全程式碼的問題。

如何運作

該專案採用「紫隊」(purple teaming)方法,結合攻擊(紅隊)與防禦(藍隊)策略,以評估與緩解風險。它提供三大類工具:

  • 系統級防護:包括 Llama Guard,一系列用於檢測違規內容的審核模型;Prompt Guard,用於防範提示注入與越獄攻擊;以及 Code Shield,在推理時過濾 LLM 產生的不安全程式碼。
  • 評估與基準測試CyberSec Eval 系列(v1、v2 和 v3)提供業界標準基準,用於量化網路安全風險、衡量程式碼解釋器被濫用的可能性,並測試視覺提示注入與魚叉式網路釣魚能力。

適用對象

需要為開源生成式 AI 模型部署信任、安全與防護層,以確保其應用安全並符合內容規範的開發者與研究人員。

主要亮點

  • Llama Guard 3:高效率審核模型,支援多語言,具備 128k 上下文視窗,支援圖像推理。
  • Prompt Guard:專門用於檢測並阻止提示注入與越獄嘗試的工具。
  • Code Shield:在推理時進行過濾,防止不安全程式碼執行或程式碼解釋器被濫用。
  • CyberSec Eval:基於業界標準(CWE 和 MITRE ATT&CK)的綜合性基準測試套件,用於評估 LLM 的網路安全風險。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • Dispatch