Anthropic Constitutional Classifiers++ 發佈
Anthropic 開發了 Constitutional Classifiers++,這是一種次世代安全系統,旨在保護大型語言模型免受越獄(jailbreaks)攻擊——這些技術被用於規避安全護欄,以誘導出有害資訊,特別是關於化學、生物、放射性或核子(CBRN)武器的資訊。這套新系統將安全監控的運算成本顯著降低至約 1%,同時在測試期間消除了通用越獄攻擊的發現。
從第一代 Constitutional Classifiers 的演進
原始的 Constitutional Classifiers 是基於從自然語言規則「憲法」中衍生的合成數據進行訓練的安全防護機制。雖然它們將越獄成功率從 86% 降低至 4.4%(阻擋了 95% 的攻擊),但卻引入了顯著的營運權衡:
- 運算成本: 增加了 23.7% 的運算成本。
- 誤拒絕(False Refusals): 對無害查詢的拒絕率增加了 0.38%。
- 脆弱性: 在漏洞賞金計畫中發現了一個通用越獄攻擊。
Constitutional Classifiers++ 的架構
Constitutional Classifiers++ 利用集成防禦(ensemble defense)和「級聯架構」(cascade architecture)來平衡強韌性與效率。該系統分為兩個階段運作:
第一階段:內部探測分類器(Internal Probe Classifiers)
第一階段使用線性探測(linear probes)來監控 Claude 的內部激活(activations)。這些探測器會在回應生成之前,識別出模型神經網路中暗示有害內容的模式。由於這些探測器重複使用了現有的運算,因此它們的運算成本非常低,且比最終輸出更難被攻擊者操縱。
第二階段:對話交換分類器(Exchange Classifiers)
如果內部探測將一次對話交換標記為可疑,它將被提升至更強大的第二階段分類器。與先前分別篩選輸入與輸出的版本不同,這種「對話交換分類器」會在輸入的上下文環境中監控輸出。這使得系統能夠檢測出只有在同時觀察輸入與輸出時才明顯的有害意圖,例如當攻擊者使用代碼(例如,使用「食品香料」來指代化學試劑)時。
性能與基準測試
在 Claude Sonnet 4.5 的流量部署中,Constitutional Classifiers++ 系統展現了以下結果:
- 拒絕率: 對無害查詢的拒絕率降至 0.05%,與原始系統相比降低了 87%。
- 運算開銷(Compute Overhead): 當應用於 Claude Opus 4.0 的流量時,系統增加了大約 1% 的運算開銷。
- 強韌性: 在 198,000 次紅隊測試(red-teaming)嘗試中(累計超過 1,700 小時),僅發現了一個高風險漏洞,檢測率為每千次查詢 0.005。未發現任何通用越獄攻擊。
已識別的脆弱性與模型退化
儘管有這些改進,Anthropic 仍識別出兩類仍具挑戰性的攻擊方式:
- 重構攻擊(Reconstruction Attacks): 這些攻擊將有害資訊拆解成看似無害的片段,隨後再重新組裝(例如,將查詢嵌入為跨代碼庫的函數)。
- 輸出混淆攻擊(Output Obfuscation Attacks): 這些攻擊促使模型使用隱喻、謎語或無害的替代詞來偽裝輸出。
Anthropic 指出,這些越獄嘗試往往會導致模型實際能力的退化。在 GPQA Diamond 基準測試(博士級科學概念)中,當應用某些越獄技術時,模型性能從 74% 下降到低至 32%。
未來研究方向
Anthropic 正在探索幾種進一步強化系統的方法,包括:
- 將分類器信號直接整合到回應生成過程中。
- 將模型訓練得對混淆更具抵抗力。
- 利用自動化紅隊測試來為分類器生成更高品質的訓練數據。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch