Anthropic ASL-3 安全防禦漏洞獎勵計畫

Anthropic 已啟動一項漏洞獎勵計畫,旨在對旨在防止 AI 被誤用於化學、生物、放射性及核能 (CBRN) 武器的安全分類器進行壓力測試。此舉是 Anthropic 為符合其《負責任擴展政策》(Responsible Scaling Policy) 中定義的 AI 安全等級 3 (ASL-3) 部署標準所做努力的一部分。

壓力測試憲法分類器 (Constitutional Classifiers)

Anthropic 正與 HackerOne 合作管理一項漏洞獎勵計畫,以測試其「憲法分類器」系統的更新版本。憲法分類器旨在透過遵循一套根據特定危害定義允許與不允許內容的原則,來防禦可能引發 CBRN 武器相關資訊的越獄 (jailbreak) 攻擊。

在計畫的初始階段,參與者獲准提前測試這些分類器在 Claude 3.7 Sonnet 上的表現。該計畫針對已驗證的「通用越獄」(universal jailbreaks)——即在多個主題上都能一致繞過安全措施的漏洞——提供高達 25,000 美元的獎勵,特別是那些能導致 CBRN 相關主題誤用的漏洞。

與《負責任擴展政策》(RSP) 的一致性

此漏洞獎勵計畫是《負責任擴展政策》(RSP) 框架的直接應用,該框架規範了 Anthropic 如何開發與部署能力日益增強的模型。公司表示,隨著模型能力的提升,可能需要 ASL-3 標準中所概述的高級安全與防禦保護。此舉作為一種方法,在這些 ASL-3 防護措施公開部署之前,對其進行迭代與壓力測試。

計畫的演進與擴展

在 2025 年 5 月 18 日初始計畫結束後,Anthropic 於 2025 年 5 月 22 日宣布了一項更新,將此計畫轉型為新階段。這個新的僅限受邀參與的計畫專注於:

  • Claude Opus 4 測試: 在新的 Claude Opus 4 模型上對憲法分類器系統進行壓力測試。
  • 一般安全系統: 測試目前正在開發中的其他安全系統。
  • 公開報告收集: Anthropic 現在接受有關 ASL-3 關注用途的通用越獄報告——特別是那些在社交媒體等公開平台或論壇上發現的、會引發生物威脅相關資訊的漏洞——

參與要求

參與漏洞獎勵計畫採僅限受邀制,以確保及時的反饋與回應。Anthropic 鼓勵在識別語言模型越獄方面具有證明實力的資深紅隊人員 (red teamers) 與研究人員申請受邀。

Sources

相關