OpenAI 提示注入安全概覽
提示注入是針對對話式 AI 的社交工程攻擊
提示注入發生在第三方——既不是使用者也不是 AI——將惡意指令插入對話的上下文中以誤導模型時。這通常發生在 AI 存取外部內容時,例如網頁、文件或電子郵件,這些內容可能包含旨在欺騙 AI 執行非預期動作的隱藏指令。
隨著 AI 工具從簡單的問答系統過渡到能夠瀏覽網頁、規劃行程和存取應用程式資料的代理,這些攻擊的風險增加。潛在結果包括:
- 次佳建議: 攻擊者可能在列表中隱藏指令,迫使 AI 無視使用者偏好而推薦特定房產。
- 資料外洩: 攻擊者可能發送包含錯誤資訊的電子郵件,欺騙 AI 代理尋找並共享使用者的銀行對帳單。
OpenAI 的多層防禦策略
OpenAI 使用幾種重疊的技術和程序防護措施來降低提示注入風險並提升模型穩健性。
安全訓練與研究
OpenAI 使用安全訓練來協助模型識別並忽略提示注入模式。這包括開發 Instruction Hierarchy,旨在協助模型區分可信和不可信指令的研究。公司也利用自動紅隊演練來發現並開發新型攻擊向量,以進行主動緩解。
自動監控
AI 驅動的監控器會被部署以即時識別和阻止提示注入攻擊。這些監控器補充安全訓練,允許快速更新以阻止新的攻擊模式,並協助 OpenAI 在攻擊廣泛部署之前偵測對抗性研究和測試。
基礎設施與安全防護
針對特定產品的安全措施已實施以保護使用者資料:
- Link Approval: ChatGPT 可能要求使用者在訪問某些連結之前先予以批准,特別是對於已請求不被編目之網站。
- Sandboxing: 對於執行程式或程式碼的工具(例如 Codex 或 Canvas),會使用沙盒來防止模型因注入而做出有害的變更。
使用者控制與透明度
OpenAI 整合了讓使用者管理自身風險的控制機制:
- Logged-out Mode: 在 ChatGPT Atlas 中,使用者可以選擇在未登入網站的情況下開始任務。
- Confirmation Prompts: 代理在執行敏感動作(例如完成購買)之前會暫停並要求確認。
- Watch Mode: 對於敏感網站,此模式會提醒使用者並要求瀏覽器分頁保持活躍;如果使用者離開該分頁,代理將暫停。
- Education: OpenAI 提供說明,說明在將 ChatGPT 連接至其他應用程式時所存取的資料及其相關風險。
外部驗證
OpenAI 利用內部與外部紅隊演練(專注於提示注入的數千小時)以及漏洞賞金計畫,獎勵能夠展示導致非預期資料洩露的真實攻擊路徑的獨立安全研究者。
AI 代理安全的使用者最佳實踐
為降低提示注入的風險,OpenAI 建議以下行為防護措施:
- 限制資料存取: 使用類似「登出」模式的功能,將代理的存取限制為僅執行任務所需的必要憑證或敏感資料。
- 驗證後續動作: 在允許代理發送電子郵件或完成購買之前,仔細檢查確認提示。
- 主動監控: 當代理在敏感網站(例如銀行)上運作時,使用者應該主動監視代理的工作。
- 提供明確指令: 避免使用寬泛的指令如「檢閱我的電子郵件並採取必要的行動」。而是提供具體、狹窄的指令,以增加惡意內容誤導模型的難度。
AI 安全的未來展望
OpenAI 將提示注入描述為一項前沿研究問題,將需要持續演進風險緩解策略。儘管目前尚未觀察到攻擊者大規模採用這些技術,但 OpenAI 正在投資研究以提升 AI 穩健性,並計畫發佈一份即將發布的報告,內容為偵測 AI 與網際網路通訊時傳輸對話資訊的情況。