GPT-Red: 解鎖自我改進以提升穩健性

GPT-Red: 解鎖自我改進以提升穩健性

OpenAI 已開發 GPT-Red,一種自動化紅隊模型,旨在擴大漏洞發現並提升模型穩健性。透過使用 GPT-Red 對生產模型進行對抗訓練,OpenAI 已顯著降低其最新版本對提示注入的易感性,特別是 GPT-5.6 Sol。

透過 GPT-Red 的自動化紅隊

GPT-Red 是一個僅供內部使用的模型,經過訓練以充當複雜的攻擊者。它透過發送提示、觀察模型回應,並迭代其方法來實現特定的惡意目標。OpenAI 使用與其某些最大後訓練運行相 comparable 的計算規模來訓練 GPT-Red,標誌著對安全專門投入的大量計算資源。

自我對弈強化學習

GPT-Red 使用自我對弈強化學習框架進行訓練。在此設置中,GPT-Red 與一組多樣化的「defender」LLM 同時在各種紅隊場景中進行訓練:

  • 獎勵: 當 GPT-Red 成功引發失敗時(例如成功的提示注入),它會獲得獎勵。相反地,防禦模型在抵禦攻擊並完成其原始任務時會獲得獎勵。
  • 共同演化: 隨著防禦模型變得更強健,GPT-Red 被迫發現越來越強大且多樣化的攻擊向量。
  • 環境模擬: 訓練發生在真實場景中,其中提示注入可以插入本地檔案、網頁橫幅、電子郵件正文或工具輸出。

對模型穩健性的影響:GPT-5.6 Sol

OpenAI 直接將 GPT-Red 整合到生產模型的訓練過程中。此對抗訓練為 GPT-5.6 Sol 帶來了顯著的穩健性提升,使其成為至今最能抵禦提示注入的模型。

關鍵穩健性基準

  • 提示注入減少: 與四個月前的最佳生產模型相比,GPT-5.6 Sol 在最難的直接提示注入基準上失敗次數減少了 6 倍。
  • 直接注入成功率: 在廣泛的穩健性環境中,GPT-5.6 Sol 對 GPT-Red 的直接提示注入僅失敗 0.05%。
  • 特定攻擊類別: GPT-Red 的早期版本發現了「Fake Chain-of-Thought」攻擊,該攻擊對 GPT-5.1 的成功率為 95%,但對 GPT-5.6 已降低至低於 10%。
  • 基準飽和: 最新模型已使多個針對瀏覽和開發工具的間接提示注入基準達到飽和,準確率超過 97%。

泛化與真實世界效果

為了評估 GPT-Red 是否為通用紅隊代理,OpenAI 在其訓練期間未見過的新環境和目標模型上測試了其效果。

與人類紅隊的比較

在 Dziemian 等人 (2025) 間接提示注入競技場的複製版本中,GPT-Red 與人類紅隊進行對抗,目標為攻擊 GPT-5.1。GPT-Red 的攻擊成功率達到 84%,顯著高於人類僅 13% 的成功率。

真實世界案例研究

  • AI 自動販賣機 (Vendy): GPT-Red 成功攻擊了管理自動販賣機的即時自主代理。透過先在模擬中迭代,然後將攻擊轉移到即時代理,GPT-Red 達成了三個惡意目標:將昂貴商品價格改為 $0.50、訂購新的昂貴商品並以 $0.50 提供,以及取消其他客戶的訂單。
  • Codex CLI 代理: 在 10 個數據外洩場景的套件中,GPT-Red 在迫使基於 GPT-5.4 mini 的 Codex CLI 代理外洩敏感數據方面,比基於提示的 GPT-5.5 基線更有效且更節省 token。

能力維持

OpenAI 報告表示,穩健性的提升並未以一般能力或過度拒絕的增加為代價。對一般前沿能力和目標過度拒絕任務的評估顯示,正常能力不受影響,這表明穩健性的提升來自於對惡意指令的更好抵抗,而不是對合法請求的預設拒絕。

摘要: OpenAI 已引入 GPT-Red,一種透過自我對弈強化學習進行訓練的自動化紅隊模型,用於識別漏洞並對抗性地訓練未來模型(如 GPT-5.6 Sol),使其對提示注入更具穩健性。

標題: GPT-Red: 解鎖自我改進以提升穩健性

Sources