Anthropic 瀏覽器使用之 Prompt Injection 防禦措施
Anthropic 已提升了 Claude Opus 4.5 與 Claude for Chrome 擴充功能針對 prompt injection(提示詞注入)的強韌性——這是一種隱藏在網頁內容中,旨在劫持 AI agent 的對抗性指令。雖然這些更新顯著降低了攻擊成功率,但 Anthropic 指出,對於任何執行真實世界瀏覽器操作的 agent 而言,prompt injection 仍是一個活躍的安全挑戰。
瀏覽器 Agent 中 Prompt Injection 的本質
當 AI agent 處理包含隱藏惡意指令的不可信內容(例如網頁、文件或電子郵件)時,就會發生 prompt injection。這些指令可能會覆蓋使用者的原始意圖,並強迫 agent 執行未經授權的操作。
基於瀏覽器的 agent 面臨著獨特的風險,因為攻擊面非常廣泛,涵蓋了每個網頁、廣告和動態載入的腳本。此外,由於瀏覽器 agent 可以執行高影響力的操作,潛在的危害也隨之增加,包括:
- 導航至特定 URL
- 填寫表單
- 點擊按鈕
- 下載檔案
例如,攻擊者可以在電子郵件中嵌入不可見文字,指示瀏覽器 agent 在執行如撰寫會議回覆等例行任務時,將機密通訊轉發到外部地址。
Claude 強韌性的技術改進
Anthropic 已實施多層次的防禦策略,以降低 prompt injection 的攻擊成功率 (ASR)。這些改進也促成了 Claude for Chrome 擴充功能從研究預覽版轉向 Max 計畫使用者的 beta 版。
用於抵抗力的強化學習
Anthropic 使用強化學習將強韌性直接建立在模型的核心能力中。在訓練期間,Claude 會接觸到嵌入在模擬網頁內容中的 prompt injection。當模型正確識別並拒絕遵守惡意指令時(即使是那些旨在表現得緊急或具權威性的指令),模型會獲得「獎勵」。
增強型分類器
所有進入模型上下文窗口的不可信內容都會由分類器進行掃描。這些系統旨在檢測以各種形式隱藏的對抗性指令,例如:
- 隱藏文字
- 被操縱的圖像
- 欺騙性的 UI 元件
當檢測到攻擊時,分類器會觸發干預措施,引導模型的行為,以防止 agent 遵循惡意指令。
專家人工紅隊測試
為了尋找自動化系統可能遺漏的創意攻擊向量,Anthropic 聘請了內部安全研究人員進行持續探測。此外,該公司也參與了外部 Arena 形式的挑戰,以根據行業標準來衡量其強韌性。
目前的效能與限制
根據使用自適應「Best-of-N」攻擊者的內部測試(每個環境給予 100 次嘗試),Claude Opus 4.5 與更新後的防護措施顯示,與之前的配置相比,攻擊成功率顯著降低。
然而,Anthropic 強調,沒有任何瀏覽器 agent 可以完全免疫 prompt injection。即使是 1% 的攻擊成功率也代表著實質性的風險,公司維持其觀點,認為該問題尚未完全解決。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch