Anthropic 紅隊測試語言模型報告 – 方法、規模化行為與經驗教訓
TL;DR
Anthropic 的新報告發現,隨著參數從 2.7 B 增加到 52 B,經過 RLHF 訓練的語言模型對紅隊攻擊的抵抗力日益增強;而純模型、僅使用 helpful-prompted 以及 rejection-sampling 模型則未顯示出明顯的規模化趨勢;團隊同時發布了一個包含 38,961 次攻擊的數據集以及完整的實作方法指南,以加速社群的安全工作。
規模化行為之關鍵發現
RLHF 模型隨規模增加而變得更難進行紅隊測試。 在 2.7 B、13 B 和 52 B 三種規模下,Anthropic 觀察到使用人類回饋強化學習(RLHF)訓練的模型,其遭受成功有害提示詞攻擊的次數呈單調遞減。這顯示隨著模型容量擴大,RLHF 能為對抗性探測提供日益增強的魯棒性。
其他模型類型顯示平緩的規模化趨勢。 純語言模型、被提示為「helpful, honest, and harmless」的模型,以及使用 rejection sampling 的模型,在相同的規模範圍內並未表現出紅隊測試能力的系統性變化。無論參數數量多少,它們對有害輸出的敏感度大致保持不變。
數據集發布
38,961 次紅隊攻擊現已公開。 Anthropic 發布了研究期間收集的全套對抗性提示詞及其對應的模型輸出。該數據集涵蓋了從明顯的攻擊性語言到微妙、非暴力的不道德內容等一系列有害行為,為未來的安全研究提供了寶貴的基準。
方法論概述
指令與流程透明度。 報告詳盡地記錄了紅隊測試指令、參與者招募、提示詞生成工作流以及統計分析技術。報告也討論了不確定性的來源,例如標註者之間的分歧以及自動化檢測的局限性。
統計嚴謹性。 Anthropic 採用置信區間和假設檢定來比較不同模型家族與規模下的攻擊成功率,以確保觀察到的趨勢並非樣本變異所致。
對 AI 安全社群的啟示
RLHF 可在規模化過程中提升安全性的證據。 RLHF 模型攻擊成功率的下降,支持了透過人類回饋進行模型對齊的假設,即透過人類回饋進行對齊能產生具備規模化效益的安全增益。
對共享標準的需求。 透過發布數據集與詳細的方法論指南,Anthropic 鼓勵社群建立規範、可重複的紅隊測試實作與評估模型危害的技術標準。
更廣泛的研究背景。 該報告是 Anthropic 安全研究組合的一部分,其中包括對多代理人系統(multi-agent system)失效、員工重新培訓證據以及 Claude 模型進階數學能力的相關研究。
資源
- 完整紅隊測試政策備忘錄:Anthropic_RedTeaming.pdf
- 關於多代理人系統風險的相關研究:https://www.anthropic.com/research/multiagent-systems
- 關於員工重新培訓計畫的評估:https://www.anthropic.com/research/reviewing-the-evidence-on-worker-retraining-programs
- Claude 在黎曼猜想上的數學進展:https://www.anthropic.com/research/riemann-zeta
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch