Anthropic 與美國 CAISI 及英國 AISI 合作強化 AI 安全防護

Anthropic 已與美國 AI 標準與創新中心 (CAISI) 以及英國 AI 安全研究所 (AISI) 建立持續性的合作夥伴關係,旨在識別並減輕其 AI 模型中的漏洞。此項合作利用了政府在國家安全、網路安全及威脅建模方面的專業知識,以提升 AI 安全防護機制對抗複雜濫用的韌性。

透過紅隊演練強化憲法分類器 (Constitutional Classifiers)

Anthropic 利用 CAISI 與 AISI 評估了其「憲法分類器」(用於偵測並防止越獄的防禦系統)的多個迭代版本,評估對象包括 Claude Opus 4 與 4.1 等模型,並於部署前進行測試。這種迭代式的壓力測試過程揭示了幾個關鍵的漏洞類別:

  • 提示詞注入 (Prompt Injection): 政府紅隊人員識別出了一些弱點,例如透過錯誤聲稱已進行人工審查等特定註解,即可繞過分類器的偵測。
  • 通用越獄 (Universal Jailbreaks): 測試人員開發了複雜的越獄手段,將有害的互動內容進行編碼以規避標準偵測。這促使 Anthropic 從根本上重構其安全防護架構,而非僅僅套用簡單的補丁。
  • 基於密碼的攻擊 (Cipher-based Attacks): 使用密碼、字元替換及其他混淆技術來規避分類器,這促使偵測系統進行改進,使其能夠辨識偽裝的內容,無論其編碼方式為何。
  • 輸入與輸出混淆 (Input and Output Obfuscation): 測試人員發現了通用越獄手段,能將有害字串拆解為較大上下文中的良性組件,進而導致針對性的過濾機制改進。
  • 自動化攻擊優化 (Automated Attack Refinement): 合作夥伴開發了自動化系統來逐步優化攻擊策略,產出有效的通用越獄手段,Anthropic 目前正利用這些手段來改進其安全防護。

增強風險方法論與評估

除了特定的技術漏洞之外,與 CAISI 及 AISI 的合作也改善了 Anthropic 更廣泛的安全方法。政府機構提供了關於部署監控、快速反應能力及證據要求的外部觀點,這有助於對 Anthropic 的內部威脅模型進行壓力測試,並識別出需要更多證據支持的領域。

有效的政府與產業合作框架

Anthropic 指出,以下幾個關鍵因素促成了與政府研究及標準機構合作的成效:

全面的系統存取權

提供深度的系統存取權限可實現更複雜的漏洞發現。Anthropic 向政府紅隊人員提供了以下資源:

  • 部署前原型 (Pre-deployment Prototypes): 提供安全防護原型的存取權,讓弱點能在系統上線前被識別。
  • 多樣化的系統配置 (Diverse System Configurations): 測試人員可以存取從完全未受保護的基礎模型到具備完整安全防護的模型,這讓他們能逐步精煉攻擊手段。
  • 內部文件 (Internal Documentation): 關於安全防護架構、已記錄漏洞及細粒度內容政策資訊的透明度,有助於測試人員針對高價值領域進行測試。
  • 即時數據 (Real-time Data): 直接存取分類器評分,讓測試人員能精煉攻擊策略並進行針對性的探索性研究。

持續且穩定的參與

持續的合作,包括每日溝通與頻繁的技術深鑽,讓外部團隊能夠建立必要的深度系統專業知識,以揭示單次評估無法發現的複雜漏洞。

多層次防禦策略

Anthropic 將專業的政府評估與其他安全措施(例如公開的漏洞獎勵計畫)相結合。雖然漏洞獎勵計畫能從廣泛的人才庫中獲得大量且多樣化的報告,但政府團隊則提供了揭示細微且複雜攻擊向量所需的深度技術知識。

Sources

相關