開放式大型語言模型的憲法式 AI
Hugging Face 發布了一套完整的食譜與新工具 llm-swarm,用於在開源大型語言模型上實作憲法式 AI(CAI)。此方法讓開發者能透過讓 AI 根據一套定義好的「憲法」原則批評並修正自身輸出,將模型對齊至特定的價值觀與安全防護欄,從而免除昂貴的人類標記偏好資料的需求。
憲法式 AI(CAI)流程
憲法式 AI 讓模型透過三步迭代流程自行對齊,將不良回應轉變為安全、對齊的回應:
- Initial Response: 模型收到可能有害或不當的問題提示(例如,「如何偷 iPhone?」)。
- Self-Critique: 要求模型根據一組憲法原則批評自己的輸出(例如,「討論回應可能違法或危險之處」)。
- Revision: 模型重新撰寫回應,去除有害內容並符合憲法規範。
此流程會產生兩種合成資料集供後續訓練:
- Supervised Fine-Tuning (SFT) Dataset: 初始提示與最終修訂回應的配對。
- Preference Dataset: 包含修訂回應(首選)與初始不當回應(被拒絕)的配對。
使用 llm-swarm 進行可擴展的合成資料生成
為了產生 CAI 所需的數萬筆合成回應,Hugging Face 推出了 llm-swarm。此工具專為在 Slurm 叢集上分散式生成而設計,並以 TGI(文字生成推論)與 vLLM 為動力。
llm-swarm 的主要功能包括:
- Automated Endpoint Management: 它會透過
sbatch自動啟動推論實例,並在工作完成後終止,以防止 GPU 浪費。 - Load Balancing: 它使用 nginx Docker 容器,以「最少連線」策略在多個端點之間分配請求,確保高度可擴展性。
技術實作與模型效能
在實作上,Hugging Face 以 mistralai/Mistral-7B-Instruct-v0.1 為起點,因其具備強大的指令遵循能力且缺乏內建防護欄。他們使用 Anthropic 的 HH 偏好資料集作為紅隊測試提示,並將產生的 CAI 資料集與 Ultrachat 資料集合併,以維持一般的有用性。
有用性與「對齊稅」
使用 MT Bench 的評估顯示,在 CAI 資料集上訓練並不一定會降低模型的有用性。某些情況下,加入 CAI 資料甚至提升了 MT Bench 分數。例如,加入 15% 的 cai-conversation-harmless 資料集(約 32k 筆範例)使 SFT 模型的分數從約 6.25 提升至約 6.38。
安全性與韌性
將 CAI 模型與基線 SFT+DPO 模型在 10 個紅隊提示與「DAN」(Do Anything Now)破解提示下進行比較,結果顯示韌性有顯著提升:
| 方法 / 提示方式 | 無提示 | 安全系統提示 | DAN 提示 | 安全系統提示 + DAN 提示 |
|---|---|---|---|---|
| CAI (SFT + DPO) | 10/10 | 10/10 | 5/10 | 7/10 |
| CAI (SFT only) | 10/10 | 10/10 | 5/10 | 7/10 |
| Baseline (SFT + DPO) | 5/10 | 4/10 | 1/10 | 1/10 |
研究結果顯示,單靠安全系統提示對破解幾乎無效,而經 CAI 訓練的模型在面對提示注入時顯著更具韌性。
對齊風格的彈性
由於 CAI 依賴一套定義好的憲法,安全防護欄的「個性」可以客製化。Hugging Face 透過打造「Grok 風格」模型示範,該模型使用諷刺與幽默來拒絕有害請求,而非一般的禮貌拒絕。
透過調整憲法,使其要求以諷刺方式指出不敏感或以幽默方式拒絕犯罪計畫,他們產生了 grok-conversation-harmless 資料集。測試顯示,Grok 風格的 CAI 模型(SFT+DPO)在多種提示方式下皆達到 10/10 的安全成功率,包含對 DAN 提示的 9/10,表現優於基線。
可用資源
- Tooling:
llm-swarmGitHub 倉庫 - Datasets:
cai-conversation-harmless(基於 Anthropic)與grok-conversation-harmless(Grok 風格) - Models:
mistral-7b-anthropic(DPO)與 [mistral-7b-grok](https://huggingface.co/HuggingFaceH4/mistral-7b-grok) (SFT) - Recipe: alignment-handbook 中的憲法式 AI 食譜
Sources
- OriginalConstitutional AI with Open LLMs