Codex 與 Claude Code 之後的 AI 安全

AI 安全的新範式

AI 安全不僅僅是「帶有 AI 的網路安全」,而是一門獨立的學科,因為大型語言模型(LLM)具有與傳統軟體根本不同的內在漏洞。傳統軟體的錯誤,例如緩衝區溢位,有明確的修補方式;但 AI 系統可能以類似人類欺騙的方式被「騙」走,形成全新類型的利用手法。

由於許多組織依賴少數前沿模型(例如支援 Codex 與 Claude Code 的模型),單一漏洞可能導致整個龐大代理生態系統出現連鎖失效。這種變化需要一種安全思維,將 AI 模型視為不可信的實體,而非可靠的軟體元件。

代理漏洞的「致命三重奏」

AI 代理的安全風險主要由三個因素組合而成,稱為「致命三重奏」。當這三個要素重疊時,通常會發生漏洞:

  1. 不受信任的資料攝取:代理從使用者無法控制的外部來源取得並解析資料(例如瀏覽網頁或閱讀電子郵件)。
  2. 存取私人資訊:代理擁有存取敏感內部資料或憑證的權限。
  3. 外洩能力:代理具備將私人資訊傳送至外部、不受信任位置的工具。

若缺少任一要素,風險將大幅降低。例如,僅產生文字且無工具存取的代理無法外洩資料;在純粹受信任環境中運作的代理也不會受到間接提示注入的威脅。

自動化紅隊測試與「Shade」系統

傳統的紅隊測試——利用人類找出模型缺陷——正被自動化系統超越。Gray Swan 開發了一個名為 Shade 的系統,這是一個自動化紅隊模型,能在固定時間內找出漏洞,表現優於人類紅隊成員。

LLM 如外星智慧

紅隊測試顯示,LLM 的運作類似「外星智慧」。它們會對人類永遠不會受騙的觸發點產生反應,同時對通常能欺騙人的手法保持韌性。這種差異意味著,僅僅擴大模型(變得更大)並不會自動提升對抗性壓力的韌性;韌性必須透過明確的訓練才能獲得。

人類與代理的韌性差距

在比較人類瀏覽器使用者與 AI 瀏覽器代理的實驗中,結果顯示人類與代理失敗的原因不同。熟練的紅隊成員可以以 60–70% 的成功率「釣」人類,而某些前沿模型對傳統網釣手法出奇地具備韌性,卻會被荒謬的提示所欺騙——例如聲稱是模擬的電子郵件,要求將所有郵件轉發至隨機地址,這種情況人類永遠不會遵從。

防禦代理:Cygnal 防護模型

僅靠提示不足以確保企業安全——因為代理常將系統指令與不受信任的輸入混淆——Gray Swan 開發了 Cygnal

Cygnal 是一個專門的過濾模型,位於 LLM 與其工具呼叫之間。與通用模型不同,Cygnal 專門訓練以偵測政策違規並抵抗對抗性壓力。它提供可配置的層級,讓企業能強制執行特定規則(例如「此代理絕不能觸及此特定資料庫」),這類規則對硬編碼的 Python 腳本而言過於抽象,卻又太關鍵,不能交由基礎模型自行決定。

AI 安全與合規的未來

隨著 AI 代理從家庭裝置轉移至企業環境(例如透過 OpenClaw 等工具),產業正朝向結構化的安全與保險堆疊發展。

原生代理身分

對「原生代理身分」的需求日益增加,這意味著不再讓代理直接繼承人類使用者的全部權限。未來可能會讓代理使用不同的「角色」或設定檔,以區分工作與家庭生活,防止權限提升與意外資料外洩。

AI 保險與「Gray Swan」事件

「Gray Swan」一詞指的是在發生前已清晰可見的低機率事件。創辦人認為,重大且公開的提示注入漏洞是必然會發生的。這一現實促使 AI 承保與保險的興起,第三方稽核人員會使用紅隊工具(如 Shade)評估風險,並在公司取得保險前建議緩解措施(如 Cygnal)。

AI 科學的自動化

最具前景的領域之一是利用 AI 代理自動化可解釋性與安全程式設計的科學。透過代理執行數千次關於模型激活模式的反事實實驗,或撰寫形式驗證的安全程式碼,產業能以比人類手動研究更快的速度擴展保護 AI 系統所需的「智慧」。


SUMMARY: Gray Swan 的 Zico Kolter 與 Matt Fredrikson 解釋了 AI 代理為何會帶來全新類型的漏洞,重點在於提示注入以及需要像 Cygnal 這樣的專門安全模型來保護企業部署。

TITLE: Codex 與 Claude Code 之後的 AI 安全

Sources