GPT-5 安全完成:从基于拒绝的方式转向以输出为中心的安全训练
OpenAI 为 GPT-5 引入了安全完成,这是一种新的安全训练方法,将模型的关注点从评估用户输入转移到评估模型自身输出的安全性。该方法使 GPT-5 能够对“双重用途”提示——意图不明确、可能用于良性或恶意目的的问题——提供有帮助的回答,而不违背安全边界。
基于拒绝的安全训练的局限性
传统的安全训练依赖于二元决策:模型要么完全满足提示,要么完全拒绝。虽然对明显有害的请求有效,但这种二元方式在处理双重用途提示时会遇到困难,例如请求提供点燃烟花所需的能量,这可能用于学校项目,也可能用于制造炸药。
在基于拒绝的系统中,模型必须判断提示是否“过于有害”而无法回答。这会导致两种次优结果:
- 过度遵从:模型向恶意用户提供危险信息。
- 过度拒绝:模型拒绝了无害的请求,导致用户体验不佳。
安全完成:以输出为中心的方法
安全完成训练将安全边界从用户输入转移到模型输出。模型不再决定是否拒绝提示,而是被训练生成在不违反安全政策的前提下尽可能有帮助的响应。
这通过后训练阶段的两个主要训练参数实现:
- 安全约束:奖励系统会惩罚违反安全政策的响应,惩罚力度根据违规的严重程度进行缩放。
- 有用性最大化:对于仍在安全边界内的响应,模型会根据其有用性获得奖励。这可以通过直接满足用户目标,或提供包含安全且有帮助的替代方案的说明性拒绝来实现。
GPT-5 的性能提升
OpenAI 将安全完成集成到 GPT-5 的推理版和聊天版中。在 GPT-5 Thinking(gpt5-r)与 OpenAI o3 的对比中,安全完成训练在安全性和有用性方面均表现出提升,尤其针对双重用途问题。
OpenAI 实验的关键发现包括:
- 更高的实用性:GPT-5 Thinking 在安全响应的安全得分和平均有用性得分上均高于 o3。
- 降低危害严重性:当模型出现错误并生成不安全输出时,其严重程度低于基于拒绝训练的模型产生的不安全输出。
安全研究的演进
安全完成代表了 OpenAI 在平衡安全与实用性方面方法的演进。GPT-4 使用基于规则的奖励来管理有用性与安全性之间的权衡,而 GPT-5 的安全完成则更深入地整合了这两个目标。通过关注响应的安全性而非提示的意图,OpenAI 旨在为处理日益复杂的安全挑战奠定更具细微差别的基础。