OpenAI 指令层级改进与 GPT‑5 Mini‑R

OpenAI 开发了一种方法来提升前沿大模型的指令层级,使模型能够可靠地将高信任度指令置于低信任度指令之上。此进展提升了安全可控性,并增强了对提示注入攻击(尤其是嵌入在工具输出中的攻击)的鲁棒性。

指令层级框架

为了解决来自多个指令来源的冲突,OpenAI 模型遵循明确的信任层级:系统 > 开发者 > 用户 > 工具

在此框架下,优先级更高的指令被视为更具权威性。模型仅在不与更高优先级角色设定的约束冲突时,才会遵循低优先级指令。例如,若系统消息包含安全策略,模型必须拒绝违反该策略的用户请求。同样,若工具输出包含恶意指令,模型应忽略这些指令,而不是将其当作命令执行。

指令层级训练中的挑战

虽然强化学习(RL)是教授此层级的合适方法,OpenAI 发现了在朴素 RL 应用中存在的三大陷阱:

  1. 指令遵循失败: 模型可能未能解决冲突,并非因为误解层级,而是因为指令本身过于复杂。
  2. 主观冲突: 指令冲突可能微妙,使用另一 LLM 作为评判者来分配奖励会引入不可靠性。
  3. 奖励捷径: 模型可能学习到最大化奖励的捷径,例如过度拒绝——模型即使面对良性请求也会拒绝,以确保安全。

IH‑Challenge 方法

OpenAI 通过设计 IH‑Challenge,一个基于三大核心原则的强化学习训练数据集,来解决上述陷阱:

  • 简洁性: 任务在指令遵循层面上保持简单,以便孤立层级挑战。
  • 客观评分: 任务可通过简易 Python 脚本客观评分,省去易错的 LLM 评判。
  • 无平凡捷径: 环境结构防止模型通过简单捷径获得高奖励。

每个任务包含一次对话,高权限角色给出指令(例如 “仅回答 ‘是’ 或 ‘否’”),而低权限角色尝试诱导模型违背该指令。随后,模型的回复会被程序化检查,以确认是否遵守更高层级的约束。

GPT‑5 Mini‑R:性能与鲁棒性

OpenAI 使用 IH‑Challenge 训练了内部模型 GPT‑5 Mini‑R。该模型在多个基准上表现提升,且未出现过度拒绝的现象。

学术基准结果

评估 GPT‑5‑Mini GPT‑5 Mini‑R 提升
Gandalf Password (sys‑user) 0.99 0.99 +0
Gandalf Password (dev‑user) 0.98 1.00 +0.02
TensorTrust (sys‑user) 0.86 0.94 +0.08
TensorTrust (dev‑user) 0.76 0.91 +0.15
RealGuardrails (Distractors) 0.88 0.95 +0.07
RealGuardrails (Handwritten) 0.82 0.89 +0.07
System IFEval 0.92 0.96 +0.04

内部基准结果

评估 GPT‑5‑Mini GPT‑5 Mini‑R 提升
TutorJailbreak (sys‑user) 0.96 0.99 +0.03
Tutor Jailbreak (dev‑user) 0.97 0.99 +0.02
System <> User Conflict 0.84 0.95 +0.11
System <> Developer Conflict 0.86 0.86 +0
Developer <> User Conflict 0.83 0.95 +0.12

能力保持

GPT‑5 Mini‑R 在保持通用能力的同时,仅出现轻微回退。虽然在 Chat WinRate(相较于 o1)下降了 0.05,偏好分数下降了 0.06,但在 IH‑Challenge 过度拒绝指标上显著提升(从 0.79 提升至 1.00)。

真实场景的安全与安全性影响

提升指令层级带来两大安全收益:

安全可控性

通过在系统提示中加入特定类别的安全规范,GPT‑5 Mini‑R 在 OpenAI 安全生产基准的禁用类别上实现了更高的拒绝率和安全完成率。此提升并未导致整体有用性下降,说明模型并非简单地拒绝更多请求,而是更善于在低优先级指令出现不安全请求时进行冲突解决。

提示注入鲁棒性

GPT‑5 Mini‑R 对嵌入在工具输出中的恶意指令表现出更强的抵抗力。在学术基准 CyberSecEval 2 以及 OpenAI 内部提示注入基准上的评估表明,经过 IH 训练的模型相较基线 GPT‑5 Mini 有显著性能提升。

结论与数据集发布

随着 AI 系统变得愈加自主和具备代理特性,能够优先执行可信指令的能力成为关键安全属性。OpenAI 已发布 IH‑Challenge 数据集,以支持该领域的进一步研究。

Sources