Hugging Face: Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal

Refined Safety Boundaries Over Broad Topic Refusal

大多數的安全性對齊過程將危害視為整個主題的屬性,導致模型拒絕該類別(例如:武器或詐欺)中的所有提示詞,而不論其意圖為何。這種方法會產生一種失效模式,即模型僅僅因為提示詞包含「看起來很危險」的詞彙,就拒絕了安全的提示詞。為了瞭解這一點,Hugging Face 與 Multiverse Computing 提出了「窄邊界安全性」(narrow-boundary safety)方法,使模型能夠僅拒絕主題中具危害性的子集,同時繼續回答良性的補充部分。

The Narrow-Boundary Safety Framework

窄邊界安全性將問題形式化為一個主題宇宙,其中包含一個必須被拒絕的目標危害子集,以及一個必須被回答的良性補充部分。目標是在模型行為中創造一個「陡峭的階梯」:在危害子集內部立即拒絕,而在該主題的其他任何地方都保持提供幫助的能力。

由於標準的交叉熵訓練(cross-entropy training)通常會將拒絕機率向良性領域推移,研究人員利用成對的提示詞來操作化邊界。這些提示詞對共享一個主題錨點,但在意圖上有所不同——一個提示詞旨在被拒絕,另一個則旨在被回答。政治說服被用作本研究的測試平台,因為它允許在操縱性說服(有害)與事實性政治資訊(良性)之間進行清晰的區分。

Addressing Failures in Self-Generated Safety Tuning

當標準的自我生成安全性微調(self-generation pipelines)——即引導模型走向拒絕並由守護模型(guard model)驗證結果——應用於窄邊界時,會面臨三個主要弱點:

1. Coverage Gaps

單次引導(single-shot steering)通常無法產生被接受的拒絕,導致難度較高的提示詞被默默地捨棄。在一個經過審計的集合中,單次生成捨棄了 19.88% 的提示詞(8,009 個範例)。研究人員實施了遞增式重試策略,使用逐漸增強的引導,將殘餘失敗率降低至 0.20%(79 個提示詞),並將有害訓練集擴大到 40,293 個提示詞。

2. Downside Reactions

安全性微調通常會觸發對表面上看起來危險的良性提示詞的錯誤拒絕。為了減輕這一點,研究人員將 11,955 個經過驗證的、表面危險的良性提示詞(涵蓋 18 種語義類型)納入訓練數據中,確保模型在訓練期間會遇到具有危險措辭的良性提示詞。

3. Boundary Measurement Failures

標準的有害-良性劃分無法衡量邊界的實際形狀。模型可能僅僅透過擴大其拒絕區域進入許可提示詞中,來顯得「更安全」。為了瞭解這一點,研究人員使用了留出的有害-良性對(每邊 1,539 個)來直接衡量邊界的兩側。

The Trade-off Between Safety and Over-Refusal

在 Qwen3-8B 上的測試證明,雖然遞增式覆蓋訓練顯著提高了分布內(in-distribution)的政治拒絕率(從 9.47% 提高到 84.75%),並降低了在 HarmBench 和 WildJailbreak 等基準測試中的不安全回應,但它也可能大幅增加過度拒絕(over-refusal)。在 XSTest 上,最強配置下的過度拒絕率從 2.00% 上升到 74.00%。

為了在不犧牲安全性的情況下修正這一點,研究人員發現了兩個有效的數據組件:

  • Self-Generated Responses: 替換外部合規性回應,改用由目標模型生成的經過驗證的回應,可將 XSTest 的過度拒絕率從 15.20% 降低到 5.20%。
  • Boundary Pairs: 增加良性邊界數據,可將留出對中值得遵守的側邊的過度拒絕率從 32.94% 降低到 4.16%,同時拒絕有害側的機率僅從 91.88% 輕微下降到 87.72%。

Implications for LLM Deployment

這項研究指出,安全性微調不應僅以有害拒絕率來衡量。一個拒絕更多的模型並不一定更安全;它可能僅僅是因為拒絕了合法的提示詞,而變得不再實用。控制安全性與過度拒絕之間的權衡,需要特定的數據組成、覆蓋修復、分布內補償,以及使用邊界對進行評估。

Sources