Hugging Face: 用于受控 LLM 安全拒绝的边界感知自蒸馏

相比于广泛话题拒绝,更精细的安全边界

大多数安全对齐过程将危害视为整个话题的属性,导致模型拒绝该类别下的所有提示词(例如,武器或欺诈),而不管其意图如何。这种方法会产生一种失效模式,即模型仅仅因为提示词包含“看起来危险”的词汇而拒绝安全的提示词。为了解决这个问题,Hugging Face 和 Multiverse Computing 提出了一种“窄边界安全”方法,使模型能够仅拒绝话题中有害的子集,同时继续回答良性的补充部分。

窄边界安全框架

窄边界安全将问题形式化为一个话题宇宙,其中包含一个必须被拒绝的目标有害子集和一个必须被回答的良性补充部分。目标是在模型行为中创建一个“陡峭的阶梯”:在有害子集内部立即拒绝,而在该话题的其他任何地方都保持提供帮助。

由于标准的交叉熵训练通常会将拒绝概率向外推入良性领域,研究人员使用提示词对来使边界具有可操作性。这些提示词对共享一个话题锚点,但在意图上有所不同——一个提示词旨在被拒绝,而另一个旨在被回答。政治说服被用作这项研究的测试平台,因为它允许在操纵性说服(有害)和事实性政治信息(良性)之间进行清晰的区分。

解决自生成安全微调中的失效问题

标准的自生成流水线——即引导模型走向拒绝并由守卫模型验证结果——在应用于窄边界时会面临三个主要弱点:

1. 覆盖范围缺口

单次引导往往无法产生被接受的拒绝,导致难以处理的提示词被悄无声息地丢弃。在审计池中,单次生成丢弃了 19.88% 的提示词(8,009 个示例)。研究人员实施了递增式重试策略,使用逐渐增强的引导,将残余失败率降低至 0.20%(79 个提示词),并将有害训练集增加到 40,293 个提示词。

2. 副作用反应

安全微调通常会触发对表面上看起来危险的良性提示词的错误拒绝。为了缓解这一点,研究人员在训练数据中加入了 11,955 个经过验证的表面危险良性提示词,涵盖 18 种语义类型,以确保模型在训练期间遇到带有危险措辞的安全提示词。

3. 边界测量失效

标准的有害-良性划分无法测量边界的实际形状。模型可能会通过简单地将拒绝区域扩展到许可提示词中来显得“更安全”。为了解决这个问题,研究人员使用了留出的有害-良性对(每侧 1,539 个)来直接测量边界的两侧。

安全与过度拒绝之间的权衡

在 Qwen3-8B 上的测试表明,虽然递增覆盖训练显著提高了分布内政治拒绝率(从 9.47% 提高到 84.75%),并降低了在 HarmBench 和 WildJailbreak 等基准测试上的不安全响应率(从 26.26% 降至 0.14%),但它也可能大幅增加过度拒绝。在 XSTest 上,在最强配置下,过度拒绝率从 2.00% 上升到 74.00%。

为了在不牺牲安全性的情况下纠正这一点,研究人员发现了两个有效的数据组成部分:

  • 自生成响应: 用经过验证的、由目标模型生成的响应来替换外部合规响应,将 XSTest 的过度拒绝率从 15.20% 降至 5.20%。
  • 边界对: 加入良性边界数据减少了留出对中可被遵守侧的过度拒绝率,从 32.94% 降至 4.16%,同时拒绝有害侧的比例仅从 91.88% 轻微下降至 87.72%。

对 LLM 部署的启示

这项研究表明,安全微调不应仅通过有害拒绝率来衡量。拒绝得越多的模型不一定越安全;它可能仅仅是因为拒绝了合法提示词而变得越来越不可用。控制安全与过度拒绝之间的权衡需要特定的数据构成、覆盖范围修复、分布内补偿以及使用边界对进行评估。

Sources