Anthropic 負責任縮放政策反思
Anthropic 已將其負責任縮放政策 (RSP) 投入運作,旨在將高層級的安全概念轉化為實用的指南,以管理前沿 AI 模型中的災難性風險與誤用。該政策為組織優先事項、專案時程以及威脅建模建立了結構化框架,以確保安全與防護措施能隨著模型能力的提升而同步擴展。
RSP 的五項高層級承諾
Anthropic 目前的負責任縮放框架建立在五項核心承諾之上,旨在防止在缺乏足夠防護措施的情況下部署具有危險能力的模型:
- 建立紅線能力:識別並發布在當前安全標準 (ASL-2) 下,因風險過高而無法儲存或部署的特定能力。
- 紅線能力測試:與領域專家合作設計「前沿風險評估」——透過實證測試來判斷模型是否正在接近或已達到紅線能力。
- 回應紅線能力:開發 ASL-3 標準,這是一套更高層級的安全與防護措施。若無法將 ASL-3 標準應用於具有紅線能力的模型,Anthropic 承諾將暫停訓練或部署。
- 迭代式擴展:在進行 ASL-3 活動之前,Anthropic 將定義該標準的上界,並建立新的紅線能力,以觸發對 ASL-4 標準的需求。
- 保證機制:對評估進行壓力測試、對緩解措施進行公開或專家驗證,並由董事會與長期利益信託 (Long-Term Benefit Trust) 進行監督。
威脅建模與評估方法論
Anthropic 利用其 Frontier Red Team 與 Alignment Science 團隊來識別會觸發 ASL-3 標準的能力。目前針對達到最近一次測試模型 4 倍算力的模型,正在網路安全、CBRN (化學、生物、放射性與核能) 以及模型自主性 (Model Autonomy) 領域進行測試。
評估方法
Anthropic 採用四種主要方法論來評估模型風險:
- 問答資料集:執行速度快,但可能受限於格式的侷限性。
- 人類試驗:將受模型輔助的受試者與使用搜尋引擎的受試者進行比較,以衡量誤用程度;這需要穩健的統計推論與專家基準。
- 自動化任務評估:使用虛擬環境來測試自主行動,這需要安全的基礎設施與對工具使用的手動審查。
- 專家紅隊測試:透過對話紀錄進行開放式探索,以尋求專家對相關性的意見。
評估中的技術挑戰
Anthropic 指出了關於評估可靠性的幾個開放性研究問題:
- 預測性縮放:需要將目前的證據推論至未來的風險水平,以便在達到危險閾值之前準備好緩解措施。
- 能力獲取 (Capability Elicitation):確保在測試期間能激發出所有相關能力之困難度,因為諸如提示工程 (prompt engineering) 或微調 (fine-tuning) 等技術可能會釋放出隱藏的能力。
- 外部可讀性:在預先指定測試結果時需投入努力,以避免因放寬標準而產生的生產壓力,同時尋求更好的證據聚合方式。
ASL-3 安全標準
ASL-3 標準旨在降低模型權重被非國家行為者竊取,或模型透過產品介面被誤用的風險。其目的並非防範具有實質資源的國家級行為者。
產品介面安全
Anthropic 採用「深度防禦」方法來防止人類誤用,結合了:
- 強化學習 (RLHF) 與憲法 AI (Constitutional AI)。
- 用於檢測提示詞、生成內容與對話中的誤用行為的多階段分類器模型。
- 針對越獄 (jailbreaks) 的事件響應與修補。
基礎設施與權重安全
為了防範非國家行為者,Anthropic 已增加其安全人力,目前約有 8% 的員工在安全相關領域工作。關鍵技術控制措施包括:
- 多方授權:透過要求多次核准才能進行存取,來降低數據外洩的風險。
- 時限存取控制:根據最小權限原則授予臨時存取權。
- 內部威脅緩解:將內部設備遭入侵視為最高風險向量。
治理與保證結構
為了確保 RSP 執行符合預期,Anthropic 實施了幾項監督機制:
- 中央協調:專門的負責任縮放團隊 (Responsible Scaling Team) 管理各工作流之間的依賴關係。
- 對抗性測試:Alignment Stress Testing 團隊充當「第二道防線」,對評估與干預措施進行壓力測試。
- 內部報告:非合規報告政策允許員工匿名向負責任縮放官 (Responsible Scaling Officer) 報告疑慮。
- 外部監督:定期向董事會、長期利益信託 (Long-Term Benefit Trust) 以及美國商務部工業與安全局提供更新。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch