OpenAI 基于规则的奖励用于模型安全

OpenAI 开发了基于规则的奖励(RBR),一种新的对齐方法,使 AI 模型能够安全运行,而无需大量人工数据收集。通过用明确的程序化规则替代或补充人工反馈,RBR 能够更快地更新安全策略,并在模型的有用性与防止伤害之间实现更高效的平衡。

基于规则的奖励如何运作

基于规则的奖励利用一组预定义的命题——描述期望或不期望的响应特征的简短陈述——来评估模型输出。这些命题被组合成规则,根据适用于提示的具体安全策略对响应进行分类。

三种响应类别

根据请求,系统将提示映射到以下三种期望的响应类型之一:

  • 硬性拒绝:用于犯罪仇恨言论、极端主义或暴力犯罪指令。理想的响应包括简短的道歉和无法满足请求的声明,避免评判性语言或过度冗长。
  • 软性拒绝:用于自我伤害等敏感话题。理想的响应提供富有同理心的道歉,承认用户的情绪状态,同时仍然拒绝请求。
  • 遵从:用于良性请求,模型应完整满足用户的请求。

技术实现

自动评分器(固定的语言模型)根据响应对命题的遵循程度进行打分。这些分数随后用于拟合线性模型,其权重参数从包含已知理想响应类型的少量提示数据集中学习得到。

这些 RBR 奖励被集成到标准的人类反馈强化学习(RLHF)流水线中。具体而言,它们与仅有帮助性的奖励模型的奖励相结合,并作为额外信号用于近端策略优化(PPO)算法,以鼓励模型遵守安全策略。

性能与结果

使用 RBR 训练的模型在安全性能上可与使用人工反馈训练的模型相媲美,同时提供了若干运营优势:

  • 降低过度拒绝:RBR 减少模型错误拒绝安全请求的情况,提高模型的整体实用性。
  • 效率:该方法显著降低对大量人工数据的依赖,使训练过程更快且成本更低。
  • 灵活性:通过修改或添加规则即可快速更新安全指南,无需对模型进行大量再训练。
  • 能力保持:RBR 的实施不会对常见能力基准的评估指标产生负面影响。

限制与伦理考量

虽然 RBR 对于规则明确的任务有效,但对主观性任务(如撰写高质量论文)适用性较差。为此,OpenAI 将 RBR 与人工反馈相结合,对具体指南(例如“不要使用俚语”)使用 RBR,对连贯性等细微质量使用人工反馈。

从伦理角度来看,将安全检查从人类转移到 AI 可能会降低人工监督,并在使用有偏见的模型提供 RBR 奖励时放大偏见。OpenAI 指出,研究人员必须谨慎设计 RBR,以确保公平性和准确性。

未来应用

除安全之外,OpenAI 认为 RBR 可适用于任何通过明确规则定义期望行为的任务,例如为特定应用定制响应的个性或格式。未来工作将包括消融研究以理解 RBR 组件、使用合成数据进行规则开发,以及在多领域进行更广泛的人类评估。

Sources