大型語言模型的紅隊測試

紅隊測試對於識別 LLM 弱點至關重要

紅隊測試是一種評估方式,旨在引發模型的弱點,這些弱點可能導致不良行為,例如產生錯誤資訊、偏見、仇恨、毒性內容,或洩露個人資訊。由於大型語言模型(LLMs)是以龐大資料集訓練的,它們常會出現這些行為,透過開發策略將模型導向遠離有害結果,可減輕此類問題。

區分紅隊測試與對抗性攻擊

雖然紅隊測試與對抗性攻擊皆旨在「攻擊」或「欺騙」模型產生不良內容,但它們使用的提示類型不同:

  • 對抗性攻擊: 常使用難以理解的字串(例如在提示前加上 "aaabbbcc")以降低模型效能。
  • 紅隊測試: 使用類似一般自然語言的提示,使其更能代表真實使用者互動情境。

越獄與繞過防護欄的技術

當 LLM 被操控以脫離安全防護欄時,即發生越獄。為了繞過針對安全與對齊(例如使用 RLHF 或 SFT)進行微調的模型,紅隊會採用創意策略:

  • 角色扮演攻擊: 指示 LLM 扮演惡意角色。
  • 程式碼式提示: 指示模型以程式碼而非自然語言回應,以揭露其學習到的偏見。
  • Human‑in‑the‑loop 與 LM‑based 測試: 紅隊測試可以由人類執行,也可以由另一個語言模型測試目標 LM 的有害輸出。

有用性與無害性之間的張力

模型在 有用(遵循指示)與 無害(避免助長傷害)之間存在固有的權衡。防止冒犯性產出的常見變通方法是使用分類器預測提示是否可能冒犯,並提供預設回應。然而,此做法往往使模型過度迴避,降低其實用性。

關鍵威脅情境與新興能力

隨著 LLM 獲得新興能力——即它們未被明確訓練的行為——模擬「關鍵威脅情境」變得尤為重要。這些情境包括:

  • 追求權力的行為: 模擬模型尋求資源的情境。
  • 說服: 嘗試說服人們傷害自己或他人。
  • 物理結果: 模型具備行動力以造成實體後果,例如透過 API 在網路上訂購化學藥品。

LLM 紅隊測試研究的主要發現

根據 Anthropic(Ganguli 等 2022 年與 Perez 等 2022 年)的研究,出現了以下幾項關鍵發現:

  1. 對齊並未阻止紅隊測試: 具備有用、誠實且無害行為的 few‑shot 提示 LM,並不比普通 LM 更難被紅隊測試。
  2. 規模效應: 除了 RLHF 模型隨規模增大而變得更難被紅隊測試外,模型大小與攻擊成功率之間沒有明顯趨勢。
  3. 迴避性: 模型可能透過變得迴避來學習無害,這與有用性形成權衡。
  4. 人類意見分歧: 人類對何謂成功攻擊的共識普遍較低。
  5. 傷害類別: 非暴力類傷害的成功攻擊率較高。
  6. 眾包限制: 眾包紅隊測試常產生重複、類似「模板」的提示。

未來方向與開源資源

紅隊測試仍是 LLM 工作流程中未被充分探索的領域。未來的重點包括建立開源資料集以支援程式碼生成越獄(例如產生 DDOS 或後門攻擊程式),以及探索迴避性與有用性之間的 Pareto 前緣。

可取得的開源資料集

  • Meta: Bot Adversarial Dialog 資料集
  • Anthropic: 紅隊測試嘗試
  • AI2: RealToxicityPrompts

Sources