GPT-5 安全完成:从基于拒绝的方式转向以输出为中心的安全训练

OpenAI 为 GPT-5 引入了安全完成,这是一种新的安全训练方法,将模型的关注点从评估用户输入转移到评估模型自身输出的安全性。该方法使 GPT-5 能够对“双重用途”提示——意图不明确、可能用于良性或恶意目的的问题——提供有帮助的回答,而不违背安全边界。

基于拒绝的安全训练的局限性

传统的安全训练依赖于二元决策:模型要么完全满足提示,要么完全拒绝。虽然对明显有害的请求有效,但这种二元方式在处理双重用途提示时会遇到困难,例如请求提供点燃烟花所需的能量,这可能用于学校项目,也可能用于制造炸药。

在基于拒绝的系统中,模型必须判断提示是否“过于有害”而无法回答。这会导致两种次优结果:

  • 过度遵从:模型向恶意用户提供危险信息。
  • 过度拒绝:模型拒绝了无害的请求,导致用户体验不佳。

安全完成:以输出为中心的方法

安全完成训练将安全边界从用户输入转移到模型输出。模型不再决定是否拒绝提示,而是被训练生成在不违反安全政策的前提下尽可能有帮助的响应。

这通过后训练阶段的两个主要训练参数实现:

  1. 安全约束:奖励系统会惩罚违反安全政策的响应,惩罚力度根据违规的严重程度进行缩放。
  2. 有用性最大化:对于仍在安全边界内的响应,模型会根据其有用性获得奖励。这可以通过直接满足用户目标,或提供包含安全且有帮助的替代方案的说明性拒绝来实现。

GPT-5 的性能提升

OpenAI 将安全完成集成到 GPT-5 的推理版和聊天版中。在 GPT-5 Thinking(gpt5-r)与 OpenAI o3 的对比中,安全完成训练在安全性和有用性方面均表现出提升,尤其针对双重用途问题。

OpenAI 实验的关键发现包括:

  • 更高的实用性:GPT-5 Thinking 在安全响应的安全得分和平均有用性得分上均高于 o3。
  • 降低危害严重性:当模型出现错误并生成不安全输出时,其严重程度低于基于拒绝训练的模型产生的不安全输出。

安全研究的演进

安全完成代表了 OpenAI 在平衡安全与实用性方面方法的演进。GPT-4 使用基于规则的奖励来管理有用性与安全性之间的权衡,而 GPT-5 的安全完成则更深入地整合了这两个目标。通过关注响应的安全性而非提示的意图,OpenAI 旨在为处理日益复杂的安全挑战奠定更具细微差别的基础。

Sources