OpenAI 指令層級:優先處理特權指令以防止提示注入

OpenAI 開發了一種方法,透過實施指令層級來減輕提示注入與越獄攻擊,該層級教導大型語言模型將特權指令(例如系統提示)優先於來自不可信使用者或第三方的低優先級文字。此方法大幅提升模型對抗對抗性攻擊的韌性,同時保持標準的運作能力。

指令平等性的脆弱性

大型語言模型(LLM)目前容易受到攻擊者以惡意提示覆寫模型原始指令的攻擊。此脆弱性源於 LLM 通常將系統提示(由應用程式開發者提供)與不可信使用者或第三方來源的文字視為同等優先級。當模型無法區分開發者指令的權威性與使用者請求時,可能會遵從使用者的惡意指令,而非開發者的安全或運作限制。

指令層級解決方案

為了解決相互競爭的指令衝突,OpenAI 提出指令層級。此框架明確定義模型在不同優先級指令衝突時的行為。透過建立清晰的優先順序,模型被訓練在高特權指令與低特權指令相矛盾時,選擇性忽略來自低特權來源的指令。

資料生成與訓練

OpenAI 使用特定的資料生成方法實作此層級,旨在教導模型遵循層級式指令。此訓練過程使模型能辨識指令的來源,並在執行時套用相應的優先級。

結果與對 GPT-3.5 的影響

將此指令層級方法套用於 GPT-3.5 時,得到以下結果:

  • 提升韌性: 模型在防禦提示注入與越獄攻擊方面顯著提升了韌性。
  • 泛化能力: 此保護延伸至在訓練階段未曾遇到的攻擊類型。
  • 最小效能折衷: 此實作對模型的標準能力僅造成極小的降級。

透過優先處理特權指令,OpenAI 展示了一條讓大型語言模型在不犧牲一般實用性的前提下,更能抵禦對抗性操控的道路。

Sources