OpenAI 指令層級改進與 GPT-5 Mini-R
OpenAI 開發了一種方法來提升前沿大型語言模型的指令層級,使模型能可靠地將高信任度指令置於低信任度指令之上。此進展提升了安全可導向性,並增強了對提示注入攻擊(尤其是嵌入於工具輸出中的攻擊)的韌性。
指令層級框架
為了解決多個指令來源之間的衝突,OpenAI 模型遵循一個明確的信任層級:System > Developer > User > Tool。
在此框架下,較高優先級的指令被視為更具權威性。模型僅在不與較高優先級角色設定的限制衝突時,才會遵循較低優先級的指令。例如,若系統訊息包含安全政策,模型必須拒絕違反該政策的使用者請求。同樣地,若工具輸出包含惡意指令,模型應忽略它們,而不是將其當作指令執行。
指令層級訓練的挑戰
雖然強化學習(RL)是教授此層級的合適方法,OpenAI 發現了在簡單 RL 應用中會出現的三大主要陷阱:
- 指令遵循失敗: 模型可能因指令本身過於複雜而未能解決衝突,而非因誤解層級。
- 主觀衝突: 指令衝突可能相當微妙,使用另一個 LLM 作為裁判來分配獎勵會引入不可靠性。
- 獎勵捷徑: 模型可能學會透過捷徑來最大化獎勵,例如過度拒絕——即使是良性的請求也會被拒絕,以確保安全。
IH‑Challenge 方法
OpenAI 透過設計 IH‑Challenge,一個基於三大核心原則的強化學習訓練資料集,來解決上述陷阱:
- 簡潔性: 任務在指令遵循上保持簡單,以便孤立層級挑戰。
- 客觀評分: 任務可使用簡單的 Python 腳本客觀評分,免除依賴不可靠的 LLM 裁判。
- 無平凡捷徑: 環境設計防止模型透過簡單捷徑取得高獎勵。
每個任務包含一段對話,高權限角色提供指令(例如「只能回答『是』或『否』」),而低權限角色試圖誘導模型違反該指令。模型的回應隨後會以程式方式檢查是否符合較高層級的限制。
GPT‑5 Mini‑R:效能與韌性
OpenAI 使用 IH‑Challenge 訓練了一個內部模型 GPT‑5 Mini‑R。此模型在多項基準測試中展現出提升的效能,且未出現過度拒絕的情況。
學術基準結果
| 評估項目 | GPT‑5‑Mini | GPT‑5 Mini‑R | 改善幅度 |
|---|---|---|---|
| Gandalf Password (sys‑user) | 0.99 | 0.99 | +0 |
| Gandalf Password (dev‑user) | 0.98 | 1.00 | +0.02 |
| TensorTrust (sys‑user) | 0.86 | 0.94 | +0.08 |
| TensorTrust (dev‑user) | 0.76 | 0.91 | +0.15 |
| RealGuardrails (Distractors) | 0.88 | 0.95 | +0.07 |
| RealGuardrails (Handwritten) | 0.82 | 0.89 | +0.07 |
| System IFEval | 0.92 | 0.96 | +0.04 |
內部基準結果
| 評估項目 | GPT‑5‑Mini | GPT‑5 Mini‑R | 改善幅度 |
|---|---|---|---|
| TutorJailbreak (sys‑user) | 0.96 | 0.99 | +0.03 |
| Tutor Jailbreak (dev‑user) | 0.97 | 0.99 | +0.02 |
| System <> User Conflict | 0.84 | 0.95 | +0.11 |
| System <> Developer Conflict | 0.86 | 0.86 | +0 |
| Developer <> User Conflict | 0.83 | 0.95 | +0.12 |
能力維持
GPT‑5 Mini‑R 在保持一般能力的同時僅出現極小的退步。雖然在 Chat WinRate 相較於 o1 下降了 0.05,Preference Score 下降了 0.06,但在 IH‑Challenge 的過度拒絕指標上從 0.79 提升至 1.00,顯示顯著改善。
現實安全與安全性影響
提升指令層級帶來兩大主要安全效益:
安全可導向性
透過在系統提示中加入特定類別的安全規範,GPT‑5 Mini‑R 在 OpenAI 的安全生產基準上於禁用類別的拒絕率與安全完成率皆有提升。此提升並未導致整體有用性下降,亦即模型並非單純增加拒絕,而是更善於在低優先級指令提出不安全請求時解決衝突。
提示注入韌性
GPT‑5 Mini‑R 對於嵌入於工具輸出的惡意指令展現更高的抗性。在學術基準 CyberSecEval 2 以及 OpenAI 內部的提示注入基準測試中,經 IH 訓練的模型相較於基線 GPT‑5 Mini 有顯著的效能提升。
結論與資料集釋出
隨著 AI 系統變得愈加自主與具代理性,能夠優先執行可信指令的能力成為關鍵安全屬性。OpenAI 已釋出 IH‑Challenge 資料集,以支援此領域的進一步研究。