開放式大型語言模型的憲法式 AI

Hugging Face 發布了一套完整的食譜與新工具 llm-swarm,用於在開源大型語言模型上實作憲法式 AI(CAI)。此方法讓開發者能透過讓 AI 根據一套定義好的「憲法」原則批評並修正自身輸出,將模型對齊至特定的價值觀與安全防護欄,從而免除昂貴的人類標記偏好資料的需求。

憲法式 AI(CAI)流程

憲法式 AI 讓模型透過三步迭代流程自行對齊,將不良回應轉變為安全、對齊的回應:

  1. Initial Response: 模型收到可能有害或不當的問題提示(例如,「如何偷 iPhone?」)。
  2. Self-Critique: 要求模型根據一組憲法原則批評自己的輸出(例如,「討論回應可能違法或危險之處」)。
  3. Revision: 模型重新撰寫回應,去除有害內容並符合憲法規範。

此流程會產生兩種合成資料集供後續訓練:

  • Supervised Fine-Tuning (SFT) Dataset: 初始提示與最終修訂回應的配對。
  • Preference Dataset: 包含修訂回應(首選)與初始不當回應(被拒絕)的配對。

使用 llm-swarm 進行可擴展的合成資料生成

為了產生 CAI 所需的數萬筆合成回應,Hugging Face 推出了 llm-swarm。此工具專為在 Slurm 叢集上分散式生成而設計,並以 TGI(文字生成推論)與 vLLM 為動力。

llm-swarm 的主要功能包括:

  • Automated Endpoint Management: 它會透過 sbatch 自動啟動推論實例,並在工作完成後終止,以防止 GPU 浪費。
  • Load Balancing: 它使用 nginx Docker 容器,以「最少連線」策略在多個端點之間分配請求,確保高度可擴展性。

技術實作與模型效能

在實作上,Hugging Face 以 mistralai/Mistral-7B-Instruct-v0.1 為起點,因其具備強大的指令遵循能力且缺乏內建防護欄。他們使用 Anthropic 的 HH 偏好資料集作為紅隊測試提示,並將產生的 CAI 資料集與 Ultrachat 資料集合併,以維持一般的有用性。

有用性與「對齊稅」

使用 MT Bench 的評估顯示,在 CAI 資料集上訓練並不一定會降低模型的有用性。某些情況下,加入 CAI 資料甚至提升了 MT Bench 分數。例如,加入 15% 的 cai-conversation-harmless 資料集(約 32k 筆範例)使 SFT 模型的分數從約 6.25 提升至約 6.38。

安全性與韌性

將 CAI 模型與基線 SFT+DPO 模型在 10 個紅隊提示與「DAN」(Do Anything Now)破解提示下進行比較,結果顯示韌性有顯著提升:

方法 / 提示方式 無提示 安全系統提示 DAN 提示 安全系統提示 + DAN 提示
CAI (SFT + DPO) 10/10 10/10 5/10 7/10
CAI (SFT only) 10/10 10/10 5/10 7/10
Baseline (SFT + DPO) 5/10 4/10 1/10 1/10

研究結果顯示,單靠安全系統提示對破解幾乎無效,而經 CAI 訓練的模型在面對提示注入時顯著更具韌性。

對齊風格的彈性

由於 CAI 依賴一套定義好的憲法,安全防護欄的「個性」可以客製化。Hugging Face 透過打造「Grok 風格」模型示範,該模型使用諷刺與幽默來拒絕有害請求,而非一般的禮貌拒絕。

透過調整憲法,使其要求以諷刺方式指出不敏感或以幽默方式拒絕犯罪計畫,他們產生了 grok-conversation-harmless 資料集。測試顯示,Grok 風格的 CAI 模型(SFT+DPO)在多種提示方式下皆達到 10/10 的安全成功率,包含對 DAN 提示的 9/10,表現優於基線。

可用資源

Sources