Anthropic 啟動 AI 安全等級 3 (ASL-3) 防護措施
Anthropic 為 Claude Opus 4 啟動 ASL-3 防護措施
Anthropic 已針對 Claude Opus 4 的發布啟動了 AI 安全等級 3 (ASL-3) 部署與安全標準。由於模型能力的持續提升,公司無法明確排除 ASL-3 風險——特別是關於化學、生物、放射性與核能 (CBRN) 武器的風險——因此採取了此項預防性且臨時性的行動。
負責任的擴展政策 (RSP) 架構
Anthropic 的 AI 安全等級 (ASL) 標準受其負責任的擴展政策 (RSP) 管理,該政策規定當模型達到特定的「能力閾值」時,必須採取更高層級的防護。
- 部署措施: 這些措施針對特定的濫用類別,主要集中於降低模型協助開發或獲取 CBRN 武器的風險。
- 安全控制: 這些措施旨在防止模型權重 (model weights) 被盜取,而模型權重代表了 AI 的核心智能。
雖然先前所有的模型都是在基準 AI 安全等級 2 (ASL-2) 標準下部署,但 Claude Opus 4 是第一個在 ASL-3 標準下部署的模型。Anthropic 已排除 Claude Opus 4 需要 ASL-4 標準的需求,並判定 Claude Sonnet 4 不需要 ASL-3 防護措施。
ASL-3 部署措施:防止 CBRN 濫用
ASL-3 部署措施狹義地集中於防止 Claude Opus 4 協助完成端到端的 CBRN 工作流程,且這些流程提供了超出大型語言模型無法實現的能力之附加價值。這些措施特別針對「通用越獄 (universal jailbreaks)」——即用於提取長鏈 CBRN 相關資訊的系統性攻擊。
為了實現這一點,Anthropic 實施了三部分策略:
1. 強化系統以抵禦越獄
Anthropic 使用 Constitutional Classifiers,這是利用有害與無害的 CBRN 相關提示詞 (prompts) 與生成內容 (completions) 的合成數據進行訓練的即時防護機制。這些分類器會監控輸入與輸出,以中等程度的運算開銷來阻擋有害的 CBRN 資訊。
2. 越獄檢測
透過專門針對 Constitutional Classifiers 進行壓力測試的漏洞獎勵計畫 (bug bounty program),結合離線分類系統與威脅情報夥伴關係,來強化監控能力,以便快速識別通用越獄。
3. 迭代式防禦改進
Anthropic 透過生成模擬已發現攻擊方式的合成越獄數據,並使用該數據來訓練更新後的分類器,藉此修復越獄漏洞。
ASL-3 安全控制:保護模型權重
ASL-3 下的安全控制旨在抵禦試圖盜取模型權重的複雜非國家行為者。該架構包含超過 100 種結合了預防與檢測的不同安全控制措施。
關鍵安全措施包括:
- 標準最佳實踐: 權重存取的雙人授權機制、強化的變更管理協定,以及終端軟體的二進位白名單機制。
- 出口頻寬控制: 一種專門的控制措施,用以限制從安全運算環境流出的數據量。由於模型權重體積龐大,限制出站網路流量可以讓 Anthropic 偵測並阻擋可能暗示資料外洩嘗試的異常頻寬使用情況。
實施理據與未來展望
Anthropic 實施 ASL-3 防護措施是為了在這些防禦機制成為強制性要求之前,主動進行優化。公司指出,危險能力評估具有挑戰性,且隨著模型接近關注的閾值時,確定其確切狀態需要更長時間。
如果進一步的評估結論顯示 Claude Opus 4 並未超越相關的能力閾值,Anthropic 可能會調整或移除這些 ASL-3 防護措施。公司打算繼續迭代這些措施,並並與產業夥伴、政府及公民社會合作,以改善 AI 防護方法。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch