審議式對齊:推理使語言模型更安全

總覽

審議式對齊教導推理模型安全規格的文本,並訓練它們在回答之前先對這些規格進行推理,從而產生更安全且適當校準的回應。

方法

該方法首先在無安全數據的情況下訓練 o‑style 模型以提升有用性,然後構建一個受監督微調資料集,其中鏈式思考完成會引用插入系統提示中的相關安全規格文本,使用具政策意識的獎勵模型過濾資料,最後利用相同的獎勵模型進行強化學習,以提升模型在安全推理中使用鏈式思考的能力。

結果

o1 模型相較於 GPT‑4o 與其他最先進的 LLM,在欠拒絕與過度拒絕兩方面實現帕累托改進,達到許多內部與外部安全基準的飽和,如 StrongREJECT 與 XSTest,並展現出對分布外安全情境的強大泛化能力。

結論

審議式對齊展示了如何利用模型能力的進步來提升 AI 安全性,在減少對人類標註資料的依賴同時,提供對合規性、拒絕與安全完成的更細緻控制。

Sources