审慎对齐:推理使语言模型更安全
Overview
审慎对齐教导推理模型安全规范的文本,并在回答前训练它们根据这些规范进行推理,从而产生更安全且适当校准的响应。
Method
该方法首先在无安全数据的情况下训练 o‑style 模型以提升有用性,然后构建一个监督微调数据集,其中思维链补全引用了插入系统提示中的相关安全规范文本,使用策略感知奖励模型过滤数据,最后使用相同的奖励模型进行强化学习,以提升模型在安全推理中使用思维链的能力。
Results
o1 模型相比 GPT‑4o 和其他最先进的 LLM,在欠拒绝和过度拒绝两方面实现了帕累托改进,覆盖了许多内部和外部安全基准,如 StrongREJECT 和 XSTest,并在分布外安全场景中表现出强大的泛化能力。
Conclusion
审慎对齐展示了如何利用模型能力的进步来提升 AI 安全性,在减少对人工标注数据的依赖的同时,提供对合规性、拒绝和安全完成的更细粒度控制。