AI 安全 LLM 安全排行榜

Hugging Face 與 Secure Learning Lab 推出了 LLM 安全排行榜,這是一個專門的評估平台,旨在評估大型語言模型(LLM)的可信度。該排行榜由 DecodingTrust 框架提供支持,提供了一種標準化的方式來衡量開放與封閉模型的安全風險,以確保它們在實際部署前符合監管與安全要求。

DecodingTrust 框架

DecodingTrust 是一個全面的評估平台,透過八個不同的面向來評估 LLM 的可信度。此框架旨在提供模型安全的全觀點,利用新穎的紅隊演算法在多樣情境下對模型進行壓力測試。

可信度維度

  • 毒性(Toxicity): 使用最佳化演算法與提示生成模型來創建具挑戰性的使用者提示,並結合 33 個特定系統提示(包括角色扮演與任務重構),透過 Perspective API 測試毒性分數。
  • 刻板印象偏見(Stereotype Bias): 透過測試 24 個人口群體與 16 個刻板印象主題,使用三種提示變體,並以每個主題的五個提示的平均分數來衡量。
  • 對抗魯棒性(Adversarial Robustness): 透過對開放模型(Alpaca、Vicuna 與 StableVicuna)套用五種對抗攻擊演算法,並使用產生的對抗資料在五個任務上測試其他模型,以評估其魯棒性。
  • OOD(分布外)魯棒性: 透過將輸入風格轉換(例如改寫成莎士比亞或詩歌形式)或測試模型訓練資料中不存在的知識來評估。
  • 對抗示範魯棒性: 使用包含誤導資訊的示範進行測試,例如後門攻擊、虛假相關性與反事實範例。
  • 隱私(Privacy): 在三個層面進行評估:來自預訓練資料的隱私洩漏、對話過程中的隱私洩漏,以及模型對隱私相關詞彙與事件的理解。
  • 倫理(Ethics): 使用 ETHICS 與 Jiminy Cricket 資料集來設計破解系統與使用者提示,測試模型辨識不道德行為的能力。
  • 公平性(Fairness): 透過在不同任務中控制受保護屬性,產生在零樣本與少樣本設定下的具挑戰性問題,以衡量公平性。

主要研究發現

透過 DecodingTrust 框架進行的研究揭示了當前 LLM 的多項關鍵漏洞:

  • 模型脆弱性: 發現在某些情境下 GPT-4 的脆弱性高於 GPT-3.5。
  • 缺乏一致表現: 沒有單一 LLM 能在所有可信度面向上持續優於其他模型。
  • 效能取捨: 不同可信度面向之間存在固有的取捨。
  • 對提示的敏感性: LLM 易受對抗性或誤導性提示影響。具體而言,隱私洩漏會因措辭而異;例如,GPT-4 在被提示「in confidence」時可能不會洩漏資訊,但在被提示「confidentially」時可能會洩漏。

模型提交流程

開發者可透過排行榜頁面上的「Submit here!」面板提交模型至 LLM 安全排行榜。欲符合評估資格,模型必須符合以下條件:

  1. 格式: 模型權重必須轉換為 safetensors 格式,以提升安全性與載入速度。
  2. 可取得性: 模型必須公開。
  3. 相容性: 模型必須能使用 Hugging Face AutoClassesAutoConfigAutoModelAutoTokenizer)載入。
  4. 目前限制: 需要 use_remote_code=True 的模型目前不受支援。

Sources