OpenAI 設計 AI 代理以抵禦提示注入

OpenAI 將提示注入防禦轉向社交工程模型

OpenAI 宣布了一種新方法來保護 AI 代理免受提示注入的威脅,拋棄僅依賴輸入過濾與「AI 防火牆」的做法,轉而將提示注入視為一種社交工程。此轉變是必要的,因為現代攻擊已從簡單的提示覆寫演變為類似社交工程的複雜操縱,使得傳統分類系統越來越難以偵測。

提示注入攻擊的演變

當外部內容中的指示試圖操縱 AI 代理執行使用者未請求的操作時,就會發生提示注入。OpenAI 觀察到,早期的攻擊相當簡單——例如在維基百科頁面加入直接指示——而現代模型對這些基本覆寫已變得更具韌性。

因此,攻擊手法已演變為包含社交工程策略。由於這些攻擊現在類似於錯資訊或謊言,往往無法被「AI 防火牆」或旨在將輸入分類為惡意或正常的中介系統捕捉。

套用社交工程風險管理框架

為了對抗這些不斷演變的威脅,OpenAI 以針對人類代理在敵對環境中使用的風險管理視角來看待 AI 代理的安全。目標是限制成功操縱的影響,而非試圖完美辨識每一個惡意輸入。

OpenAI 將 AI 代理比作人類客服代表。在此類系統中,代理必須代表雇主行事,同時面臨可能誤導其的外部輸入。為降低風險,組織實施確定性的系統與規則,以限制代理的能力,例如:

  • 能力限制: 限制代理可發放的退款或禮品卡金額。
  • 確定性緩解措施: 使用能標記釣魚郵件或對行動設定硬性上限的系統,以防止單一受損代理造成重大損害。

ChatGPT 的安全實作

OpenAI 將此社交工程框架與傳統安全工程結合,特別是來源-匯流分析。在此情境中,來源是影響系統的方式(不受信任的外部內容),而匯流則是於錯誤情境下變得危險的能力(例如,向第三方傳輸資訊)。

為防止危險行動或敏感資訊在未被察覺的情況下傳輸,OpenAI 在 ChatGPT 中實施了以下防禦措施:

  • 安全訓練: 主要防禦是安全訓練,使代理在大多數情況下拒絕惡意請求。
  • 安全 URL: 一種緩解策略,用於偵測對話中獲得的資訊即將傳輸至第三方的情況。若偵測到,系統會阻止傳輸並指示代理尋找其他途徑,或將資訊呈現給使用者以取得明確確認。

AI 代理整合的建議

對於將 AI 模型整合至應用系統的開發者,OpenAI 建議實施類似於人類代理在相同角色中所具備的控制措施。雖然 OpenAI 預期高度智慧的模型最終將比人類更能抵禦社交工程,但實施結構性控制仍是最具成本效益且可行的安全方法。

Sources