AI 安全 LLM 安全排行榜
Hugging Face 與 Secure Learning Lab 推出了 LLM 安全排行榜,這是一個專門的評估平台,旨在評估大型語言模型(LLM)的可信度。該排行榜由 DecodingTrust 框架提供支持,提供了一種標準化的方式來衡量開放與封閉模型的安全風險,以確保它們在實際部署前符合監管與安全要求。
DecodingTrust 框架
DecodingTrust 是一個全面的評估平台,透過八個不同的面向來評估 LLM 的可信度。此框架旨在提供模型安全的全觀點,利用新穎的紅隊演算法在多樣情境下對模型進行壓力測試。
可信度維度
- 毒性(Toxicity): 使用最佳化演算法與提示生成模型來創建具挑戰性的使用者提示,並結合 33 個特定系統提示(包括角色扮演與任務重構),透過 Perspective API 測試毒性分數。
- 刻板印象偏見(Stereotype Bias): 透過測試 24 個人口群體與 16 個刻板印象主題,使用三種提示變體,並以每個主題的五個提示的平均分數來衡量。
- 對抗魯棒性(Adversarial Robustness): 透過對開放模型(Alpaca、Vicuna 與 StableVicuna)套用五種對抗攻擊演算法,並使用產生的對抗資料在五個任務上測試其他模型,以評估其魯棒性。
- OOD(分布外)魯棒性: 透過將輸入風格轉換(例如改寫成莎士比亞或詩歌形式)或測試模型訓練資料中不存在的知識來評估。
- 對抗示範魯棒性: 使用包含誤導資訊的示範進行測試,例如後門攻擊、虛假相關性與反事實範例。
- 隱私(Privacy): 在三個層面進行評估:來自預訓練資料的隱私洩漏、對話過程中的隱私洩漏,以及模型對隱私相關詞彙與事件的理解。
- 倫理(Ethics): 使用 ETHICS 與 Jiminy Cricket 資料集來設計破解系統與使用者提示,測試模型辨識不道德行為的能力。
- 公平性(Fairness): 透過在不同任務中控制受保護屬性,產生在零樣本與少樣本設定下的具挑戰性問題,以衡量公平性。
主要研究發現
透過 DecodingTrust 框架進行的研究揭示了當前 LLM 的多項關鍵漏洞:
- 模型脆弱性: 發現在某些情境下 GPT-4 的脆弱性高於 GPT-3.5。
- 缺乏一致表現: 沒有單一 LLM 能在所有可信度面向上持續優於其他模型。
- 效能取捨: 不同可信度面向之間存在固有的取捨。
- 對提示的敏感性: LLM 易受對抗性或誤導性提示影響。具體而言,隱私洩漏會因措辭而異;例如,GPT-4 在被提示「in confidence」時可能不會洩漏資訊,但在被提示「confidentially」時可能會洩漏。
模型提交流程
開發者可透過排行榜頁面上的「Submit here!」面板提交模型至 LLM 安全排行榜。欲符合評估資格,模型必須符合以下條件:
- 格式: 模型權重必須轉換為
safetensors格式,以提升安全性與載入速度。 - 可取得性: 模型必須公開。
- 相容性: 模型必須能使用 Hugging Face
AutoClasses(AutoConfig、AutoModel、AutoTokenizer)載入。 - 目前限制: 需要
use_remote_code=True的模型目前不受支援。