ChatGPT Atlas: 加強瀏覽器代理防禦提示注入

OpenAI 為 ChatGPT Atlas 瀏覽器代理推出了一項安全更新,採用新訓練的對抗模型並加強防護措施以緩解提示注入攻擊。此更新是更廣泛的「快速響應迴路」的一部分,旨在通過自動紅隊演練在外部對手部署之前,內部發現新穎的攻擊策略。

瀏覽器代理中提示注入的挑戰

提示注入發生時,惡意指令被嵌入到 AI 代理處理的內容中,覆蓋使用者的意圖並劫持代理的行為。對於 ChatGPT Atlas 瀏覽器代理而言,這構成了一個重大威脅向量,因為該代理與效果上無界限的不受信任內容表面進行互動,包括:

  • 電子郵件與附件
  • 行事曆邀請
  • 共享文件
  • 論壇與社交媒體貼文
  • 任意網頁

因為該代理能執行與人類使用者類似的操作——例如發送電子郵件、轉帳或編輯雲端檔案——成功的注入可能導致未經授權地共享敏感資訊,或代表使用者執行有害操作。

透過強化學習進行自動攻擊發現

為了大規模識別漏洞,OpenAI 開發了一個基於 LLM 的自動化攻擊者,該攻擊者經過強化學習(RL)訓練。該系統旨在尋找能夠成功入侵瀏覽器代理的提示注入攻擊。

由 RL 驅動的紅隊演練方法

自動化攻擊者採用多種先進技術以提高其效能:

  • 端到端訓練: 攻擊者從自身的成功與失敗中學習,以提升其紅隊演練能力。
  • 反事實模擬: 在發動攻擊之前,攻擊者會向外部模擬器提出候選注入。模擬器提供受害代理行為的完整推理與行動軌跡,使攻擊者能夠基於豐富的情境反饋進行迭代與改進攻擊。
  • 非對稱優勢: 攻擊者擁有防禦者內部推理軌跡的特權存取權,這對外部使用者不可用,增加了在對手之前發現漏洞的可能性。

為何選擇強化學習

OpenAI 選擇使用強化學習有三個主要原因:

  1. 長期目標: 強化學習適合需要多步推理與互動、且獎勵信號稀疏且延遲的對抗任務。
  2. 前沿模型能力: 透過將前沿 LLM 訓練為自動紅隊成員,攻擊者的能力會隨著基礎模型在推理與規劃方面的提升而自動擴展。
  3. 自適應行為: 強化學習透過迭代嘗試策略並從結果中學習,模擬人類攻擊者的行為。

與先前的自動紅隊演練不同,此系統能發現複雜且長期的有害工作流程。例如,該系統發現一個漏洞:惡意電子郵件可能欺騙代理向 CEO 發送辭職信,而使用者只是請求代理起草一份外出自動回覆。

主動快速響應迴路

OpenAI 正利用自動化攻擊者的發現來推動持續的加固循環:

  • 對抗訓練: 更新後的代理模型會持續針對自動紅隊成員發現的最成功攻擊進行訓練。這種「內建」穩健性直接注入模型檢查點。
  • 防禦堆疊迭代: 攻擊追蹤用於改進非模型防護措施,包括系統層級控制、監控以及模型上下文內的安全指令。
  • 野外攻擊回應: 可從野外的外部對手觀察到的戰術回饋回圈,以模擬活動並推動平台範圍的防禦變更。

使用者安全建議

為了在系統層級加固持續進行時降低個人風險,OpenAI 建議以下做法:

  • 限制已登入存取: 在任務不需要登入帳戶存取時,使用「已登出模式」。
  • 檢查確認: 在進行之前,仔細核實所有與後果重大操作相關的確認請求,例如購買或發送電子郵件。
  • 提供明確指示: 避免使用寬泛的提示(例如,「採取任何必要的行動」)。使用具體且範圍明確的任務,可使隱藏的惡意內容較難影響代理。

Sources