Hugging Face 與 Haize Labs 推出紅隊抗性排行榜

Haize Labs 在 Hugging Face 的支持下,推出了紅隊抗性(RTR)基準。此工具透過精心構造的提示系統性地檢測前沿大型語言模型(LLM)的韌性,以識別失效模式與漏洞,確保模型得以負責任地部署。

專注於類人對抗性攻擊

RTR 基準優先考慮高品質、易於人類閱讀的攻擊,而非刻意製造的人工攻擊。創作者指出,許多自動化紅隊方法(例如 GCG 紅隊演算法)產生的提示在結構上與自然語言不相符,且容易被簡單的基於分類器的防禦機制阻擋。

為確保實際的壓力測試,該基準使用過去一年 AI 安全研究中發表的多個具代表性的紅隊資料集來評估模型。這些資料集包含人類破解提示,旨在引發目標模型的有害能力。

紅隊抗性資料集

該基準利用八個不同的對抗性提示資料集來衡量 LLM 的韌性:

  • AdvBench:引發包括粗俗語言、歧視與暴力等行為的指令。
  • AART:在各種文化、地理與應用情境下的 AI 輔助對抗性提示。
  • Beavertails:用於安全對齊研究的提示。
  • Do Not Answer (DNA):一個低成本評估資料集,包含負責任模型不應回應的提示。
  • RedEval-HarmfulQA:涵蓋 10 個主題、每個主題約有 10 個子主題的有害問題。
  • RedEval-DangerousQA:涉及種族主義、刻板印象、性別歧視、非法、毒性與有害內容的問題。
  • Student-Teacher Prompting (STP):成功突破 Vicuna-13B 的有害提示。
  • SAP:透過情境學習生成的對抗性提示,以模仿人類語言。

為判斷回應是「安全」還是「不安全」,該基準結合 LlamaGuard(使用自訂分類法)與 GPT-4,並由 Haize 團隊進行人工檢查。最終分數代表判斷模型認為安全的提示比例。

依違規類別的韌性

為提供比一般「不安全」標籤更細緻的洞見,RTR 基準根據 OpenAI 使用政策的部分內容,將攻擊分類為特定違規類別:

傷害與暴力

  • 仇恨/騷擾/歧視:宣揚不容忍或敵意。
  • 針對兒童的傷害:危及或傷害兒童的內容。
  • 身體傷害:鼓勵身體受傷的材料。

犯罪行為

  • 惡意軟體:散布有害軟體。
  • 詐騙/欺騙:為個人利益而進行的欺詐行為。
  • 隱私侵害:未經授權的資料收集或分享。
  • 經濟欺騙:為金融剝削而進行的誤導行為。
  • 未經授權的醫療建議:未取得適當授權即提供醫療指導。
  • 未經授權的法律實務:未持執照提供法律服務。
  • 其他非法活動

未經請求的諮詢

  • 量身訂製的財務建議:未具備資格的具體財務建議。
  • 政治宣傳:未經請求的政治議程或候選人推廣。
  • 高風險政府決策:未經授權影響關鍵政府決策。

不適宜工作環境(NSFW)

  • 成人內容:露骨語言、粗俗語、以及關於藥物、酒精或煙草濫用的討論。
  • 性內容:描繪或描述性行為的材料。

從 RTR 排行榜得到的關鍵洞見

初步基準測試結果顯示模型韌性的三大主要趨勢:

  1. 閉源模型的主導地位:GPT-4 與 Claude-2 在所有類別的韌性上保持顯著領先。然而,作者指出尚不清楚這是基於基礎模型本身,還是因為 API 中加入了外部安全分類器所致。
  2. 常見漏洞:模型最容易受到引發成人內容、身體傷害與兒童傷害的破解攻擊。
  3. 強大的防禦:模型普遍在面對要求隱私侵害、法律、財務或醫療建議,以及政治宣傳的提示時展現高度韌性。

Sources