Anthropic 結構化分類器:防禦通用越獄攻擊
簡要重點
Anthropic 推出 結構化分類器,這是一種基於分類器的安全機制,僅導致 0.38% 的過度拒絕率上升,並帶來約 24% 的計算成本增加,即可阻擋超過 95% 的通用越獄攻擊,適用於 Claude 3.5 Sonnet。
什麼是結構化分類器?
結構化分類器是由兩個獨立的神經分類器組成——一個用於輸入,一個用於輸出——它們在一個大型合成資料集上進行訓練,該資料集來自一份 憲法,列出了允許與禁止的內容類別(例如:芥末食譜允許,芥子氣食譜則不允許)。這些分類器會在語言模型產生或回傳內容前,標記並阻擋任何違反憲法的提示或回應。
"兩種技術都使用憲法:一份模型應遵守的原則清單。在結構化分類器的情況下,這些原則定義了允許與禁止的內容類別。"
訓練流程
- 憲法建立 – 由人工設計的無害與有害內容類別清單,初期專注於化學、生物、輻射與核(CBRN)威脅。
- 合成資料生成 – Claude 針對每個類別生成數百萬組提示-完成配對,再透過語言翻譯、風格變異(包括已知的越獄風格)與編碼技巧進行增強。
- 平衡資料集 – 加入固定數量的良性查詢(來自承包商),以維持過度拒絕率低。
- 分類器訓練 – 訓練輸入與輸出分類器,以預測提示或回應是否屬於禁止類別。
- 部署 – 推理時,分類器作為模型的門控:被拒絕的提示不會傳遞給 Claude;被拒絕的完成內容則在發送給使用者前被捨棄。
人工紅隊評估(原型)
- 設定:獨立的越獄者參與漏洞獎勵計畫,試圖迫使受原型分類器保護的 Claude 3.5 Sonnet(2024 年 6 月版)回答十個預先選定的「禁止」查詢。
- 努力:共 183 名參與者投入超過 3,000 小時,兩週內提供 15,000 美元獎金,以獲取通用越獄。
- 結果:無一人成功以單一越獄方式取得全部十個查詢的詳細答案;因此,未發現通用越獄。
- 限制:原型在無害查詢上表現出高過度拒絕率,並產生顯著的計算成本,促使進行第二輪迭代。
自動化合成評估(更新系統)
- 資料集:10,000 組合成的越獄提示,涵蓋最有效的已知攻擊與新型分類器繞過技術。
- 基線:無分類器時,Claude 3.5 Sonnet(2024 年 10 月版)允許 86% 的這些提示。
- 搭配結構化分類器:成功率降至 4.4%,表示超過 95% 的越獄嘗試被阻擋。
- 過度拒絕影響:無害查詢拒絕率上升 0.38%,在 5,000 次對話樣本中無統計顯著性。
- 計算開銷:推理成本增加 23.7%,被描述為中等程度。

實際演示(2025 年 2 月 3 日至 10 日)與真實世界紅隊發現
- 參與人數:339 名越獄者產生超過 30 萬次對話互動(約 3,700 小時)。
- 成功案例:四名參與者成功通過全部八個挑戰等級;一人實現 通用 越獄,另一人達成邊界通用越獄。
- 常見策略:
- 使用密碼與編碼技巧繞過輸出分類器。
- 角色扮演系統提示。
- 關鍵字替換(例如:「Soman」→「水」)。
- 提示注入攻擊。
- 自動評分系統表現:整體拒絕評分約 1%(第 4 題達 10%)。若透過去混淆重新評分,約 0.26% 的案例結果可能改變。
- 獎金:四名成功者共獲得 55,000 美元(完成所有等級 10,000 美元,通用越獄 20,000 美元,另加額外獎勵)。

局限與未來工作
- 覆蓋不完整:結構化分類器無法保證零通用越獄;剩餘攻擊仍需更多努力才能發現。
- 威脅持續演變:可能出現新的越獄技術,需搭配其他防禦措施(例如外部監控、動態回應策略)。
- 適應性:底層憲法可快速更新,以納入新型攻擊模式。
- 持續目標:進一步降低過度拒絕率、減少計算開銷,並在正式部署前將分類器整合至其他安全層。
此系統如何融入 Anthropic 的安全路線圖
根據 Anthropic 的 負責任擴展政策,模型在風險(包括 CBRN 相關危害)降至可接受水平後方可部署。結構化分類器旨在為已跨越 CBRN 能力門檻的模型提供必要緩解,以實現更安全地擴展日益強大的大型語言模型。
訪問演示
受結構化分類器保護的 Claude 3.5 Sonnet 實際演示曾於以下網址提供(現已存檔): https://claude.ai/redirect/website.v1.082e291e-714e-4b74-8d3d-6bb3e9114f91/constitutional-classifiers
參考資料
- 論文:結構化分類器:防禦通用越獄攻擊(arXiv 2501.18837) – https://arxiv.org/abs/2501.18837
- 相關研究:結構化 AI(arXiv 2212.08073) – https://arxiv.org/abs/2212.08073
- 漏洞獎勵計畫:https://www.anthropic.com/news/model-safety-bug-bounty
- 負責任擴展政策:https://www.anthropic.com/news/announcing-our-updated-responsible-scaling-policy
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch