OpenAI 指令层级改进与 GPT‑5 Mini‑R
OpenAI 开发了一种方法来提升前沿大模型的指令层级,使模型能够可靠地将高信任度指令置于低信任度指令之上。此进展提升了安全可控性,并增强了对提示注入攻击(尤其是嵌入在工具输出中的攻击)的鲁棒性。
指令层级框架
为了解决来自多个指令来源的冲突,OpenAI 模型遵循明确的信任层级:系统 > 开发者 > 用户 > 工具。
在此框架下,优先级更高的指令被视为更具权威性。模型仅在不与更高优先级角色设定的约束冲突时,才会遵循低优先级指令。例如,若系统消息包含安全策略,模型必须拒绝违反该策略的用户请求。同样,若工具输出包含恶意指令,模型应忽略这些指令,而不是将其当作命令执行。
指令层级训练中的挑战
虽然强化学习(RL)是教授此层级的合适方法,OpenAI 发现了在朴素 RL 应用中存在的三大陷阱:
- 指令遵循失败: 模型可能未能解决冲突,并非因为误解层级,而是因为指令本身过于复杂。
- 主观冲突: 指令冲突可能微妙,使用另一 LLM 作为评判者来分配奖励会引入不可靠性。
- 奖励捷径: 模型可能学习到最大化奖励的捷径,例如过度拒绝——模型即使面对良性请求也会拒绝,以确保安全。
IH‑Challenge 方法
OpenAI 通过设计 IH‑Challenge,一个基于三大核心原则的强化学习训练数据集,来解决上述陷阱:
- 简洁性: 任务在指令遵循层面上保持简单,以便孤立层级挑战。
- 客观评分: 任务可通过简易 Python 脚本客观评分,省去易错的 LLM 评判。
- 无平凡捷径: 环境结构防止模型通过简单捷径获得高奖励。
每个任务包含一次对话,高权限角色给出指令(例如 “仅回答 ‘是’ 或 ‘否’”),而低权限角色尝试诱导模型违背该指令。随后,模型的回复会被程序化检查,以确认是否遵守更高层级的约束。
GPT‑5 Mini‑R:性能与鲁棒性
OpenAI 使用 IH‑Challenge 训练了内部模型 GPT‑5 Mini‑R。该模型在多个基准上表现提升,且未出现过度拒绝的现象。
学术基准结果
| 评估 | GPT‑5‑Mini | GPT‑5 Mini‑R | 提升 |
|---|---|---|---|
| Gandalf Password (sys‑user) | 0.99 | 0.99 | +0 |
| Gandalf Password (dev‑user) | 0.98 | 1.00 | +0.02 |
| TensorTrust (sys‑user) | 0.86 | 0.94 | +0.08 |
| TensorTrust (dev‑user) | 0.76 | 0.91 | +0.15 |
| RealGuardrails (Distractors) | 0.88 | 0.95 | +0.07 |
| RealGuardrails (Handwritten) | 0.82 | 0.89 | +0.07 |
| System IFEval | 0.92 | 0.96 | +0.04 |
内部基准结果
| 评估 | GPT‑5‑Mini | GPT‑5 Mini‑R | 提升 |
|---|---|---|---|
| TutorJailbreak (sys‑user) | 0.96 | 0.99 | +0.03 |
| Tutor Jailbreak (dev‑user) | 0.97 | 0.99 | +0.02 |
| System <> User Conflict | 0.84 | 0.95 | +0.11 |
| System <> Developer Conflict | 0.86 | 0.86 | +0 |
| Developer <> User Conflict | 0.83 | 0.95 | +0.12 |
能力保持
GPT‑5 Mini‑R 在保持通用能力的同时,仅出现轻微回退。虽然在 Chat WinRate(相较于 o1)下降了 0.05,偏好分数下降了 0.06,但在 IH‑Challenge 过度拒绝指标上显著提升(从 0.79 提升至 1.00)。
真实场景的安全与安全性影响
提升指令层级带来两大安全收益:
安全可控性
通过在系统提示中加入特定类别的安全规范,GPT‑5 Mini‑R 在 OpenAI 安全生产基准的禁用类别上实现了更高的拒绝率和安全完成率。此提升并未导致整体有用性下降,说明模型并非简单地拒绝更多请求,而是更善于在低优先级指令出现不安全请求时进行冲突解决。
提示注入鲁棒性
GPT‑5 Mini‑R 对嵌入在工具输出中的恶意指令表现出更强的抵抗力。在学术基准 CyberSecEval 2 以及 OpenAI 内部提示注入基准上的评估表明,经过 IH 训练的模型相较基线 GPT‑5 Mini 有显著性能提升。
结论与数据集发布
随着 AI 系统变得愈加自主和具备代理特性,能够优先执行可信指令的能力成为关键安全属性。OpenAI 已发布 IH‑Challenge 数据集,以支持该领域的进一步研究。