OpenAI 指令層級改進與 GPT-5 Mini-R

OpenAI 開發了一種方法來提升前沿大型語言模型的指令層級,使模型能可靠地將高信任度指令置於低信任度指令之上。此進展提升了安全可導向性,並增強了對提示注入攻擊(尤其是嵌入於工具輸出中的攻擊)的韌性。

指令層級框架

為了解決多個指令來源之間的衝突,OpenAI 模型遵循一個明確的信任層級:System > Developer > User > Tool

在此框架下,較高優先級的指令被視為更具權威性。模型僅在不與較高優先級角色設定的限制衝突時,才會遵循較低優先級的指令。例如,若系統訊息包含安全政策,模型必須拒絕違反該政策的使用者請求。同樣地,若工具輸出包含惡意指令,模型應忽略它們,而不是將其當作指令執行。

指令層級訓練的挑戰

雖然強化學習(RL)是教授此層級的合適方法,OpenAI 發現了在簡單 RL 應用中會出現的三大主要陷阱:

  1. 指令遵循失敗: 模型可能因指令本身過於複雜而未能解決衝突,而非因誤解層級。
  2. 主觀衝突: 指令衝突可能相當微妙,使用另一個 LLM 作為裁判來分配獎勵會引入不可靠性。
  3. 獎勵捷徑: 模型可能學會透過捷徑來最大化獎勵,例如過度拒絕——即使是良性的請求也會被拒絕,以確保安全。

IH‑Challenge 方法

OpenAI 透過設計 IH‑Challenge,一個基於三大核心原則的強化學習訓練資料集,來解決上述陷阱:

  • 簡潔性: 任務在指令遵循上保持簡單,以便孤立層級挑戰。
  • 客觀評分: 任務可使用簡單的 Python 腳本客觀評分,免除依賴不可靠的 LLM 裁判。
  • 無平凡捷徑: 環境設計防止模型透過簡單捷徑取得高獎勵。

每個任務包含一段對話,高權限角色提供指令(例如「只能回答『是』或『否』」),而低權限角色試圖誘導模型違反該指令。模型的回應隨後會以程式方式檢查是否符合較高層級的限制。

GPT‑5 Mini‑R:效能與韌性

OpenAI 使用 IH‑Challenge 訓練了一個內部模型 GPT‑5 Mini‑R。此模型在多項基準測試中展現出提升的效能,且未出現過度拒絕的情況。

學術基準結果

評估項目 GPT‑5‑Mini GPT‑5 Mini‑R 改善幅度
Gandalf Password (sys‑user) 0.99 0.99 +0
Gandalf Password (dev‑user) 0.98 1.00 +0.02
TensorTrust (sys‑user) 0.86 0.94 +0.08
TensorTrust (dev‑user) 0.76 0.91 +0.15
RealGuardrails (Distractors) 0.88 0.95 +0.07
RealGuardrails (Handwritten) 0.82 0.89 +0.07
System IFEval 0.92 0.96 +0.04

內部基準結果

評估項目 GPT‑5‑Mini GPT‑5 Mini‑R 改善幅度
TutorJailbreak (sys‑user) 0.96 0.99 +0.03
Tutor Jailbreak (dev‑user) 0.97 0.99 +0.02
System <> User Conflict 0.84 0.95 +0.11
System <> Developer Conflict 0.86 0.86 +0
Developer <> User Conflict 0.83 0.95 +0.12

能力維持

GPT‑5 Mini‑R 在保持一般能力的同時僅出現極小的退步。雖然在 Chat WinRate 相較於 o1 下降了 0.05,Preference Score 下降了 0.06,但在 IH‑Challenge 的過度拒絕指標上從 0.79 提升至 1.00,顯示顯著改善。

現實安全與安全性影響

提升指令層級帶來兩大主要安全效益:

安全可導向性

透過在系統提示中加入特定類別的安全規範,GPT‑5 Mini‑R 在 OpenAI 的安全生產基準上於禁用類別的拒絕率與安全完成率皆有提升。此提升並未導致整體有用性下降,亦即模型並非單純增加拒絕,而是更善於在低優先級指令提出不安全請求時解決衝突。

提示注入韌性

GPT‑5 Mini‑R 對於嵌入於工具輸出的惡意指令展現更高的抗性。在學術基準 CyberSecEval 2 以及 OpenAI 內部的提示注入基準測試中,經 IH 訓練的模型相較於基線 GPT‑5 Mini 有顯著的效能提升。

結論與資料集釋出

隨著 AI 系統變得愈加自主與具代理性,能夠優先執行可信指令的能力成為關鍵安全屬性。OpenAI 已釋出 IH‑Challenge 資料集,以支援此領域的進一步研究。

Sources