Anthropic 負責任縮放政策更新
Anthropic 更新了其負責任縮放政策 (RSP),這是一個旨在減輕前沿 AI 系統災難性風險的風險治理框架。此次更新引入了更具彈性的風險評估與管理方法,確保安全與防護措施能隨著所開發模型的開發能力成比例地擴展。
Proportional Safeguards and AI Safety Levels (ASL)
Anthropic 採用 AI 安全等級 (ASL) 標準系統,這是一套分級的安全與防護措施。隨著模型能力的增長,這些標準的嚴格程度也會隨之提高,類似於生物研究中使用的生物安全等級。
目前,所有 Anthropic 模型均在 ASL-2 標準下運行,公司表示這反映了目前的產業最佳實踐。更新後的政策定義了兩個主要的開發能力閾值,一旦觸發,將導致轉向更高階的 ASL 標準:
- Autonomous AI Research and Development: 如果一個模型可以獨立進行通常需要人類專家知識的複雜 AI 研究任務,Anthropic 要求提升安全標準(可能為 ASL-4 或更高)以及額外的安全保證。
- Chemical, Biological, Radiological, and Nuclear (CBRN) weapons: 如果一個模型可以有效地協助具有基本技術背景的個人創建或部署 CBRN weapons,公司將要求 ASL-3 標準,其中包括強化的安全與部署控制。
ASL-3 Safeguards and Deployment Controls
當模型達到 ASL-3 閾值時,Anthropic 會實施多層次的方法來防止誤用。安全措施包括對模型權重 (model weights) 更強大的保護以及更嚴格的內部存取控制。部署防護措施包括:
- 即時與非同步監控。
- 快速反應協議。
- 快速的部署前紅隊演練 (red teaming)。
Implementation, Oversight, and Governance
為了確保 RSP 有效執行,Anthropic 建立了幾項營運流程:
- Capability Assessments: 常規評估以根據定義的開發能力閾值,判斷目前的防護措施是否仍然合適。
- Safeguard Assessments: 定期評估以驗證安全與部署安全措施是否達到要求的 ASL 標準。
- Documentation: 使用在高可靠性產業中常見的安全案例 (safety case) 方法論,來記錄評估與決策過程。
- Internal and External Review: 該框架由內部壓力測試、安全問題的內部報告流程,以及徵求外部專家回饋所支持。
Lessons Learned from Initial Implementation
在實施原版 RSP 一年後,Anthropic 發現了幾項程序上的不足,包括評估完成時間比預定計劃晚了三天,以及對於佔位符評估 (placeholder evaluations) 的定義不明確。公司得出結論,認為這些情況構成的風險極小,但凸顯了在政策中需要更大的彈性,並需改進合規性追蹤。
Organizational Changes and Leadership
Anthropic 更新了其領導層角色以管理 RSP 的縮放:
- Responsible Scaling Officer: 共同創辦人兼首席科學官 Jared Kaplan 接替 Sam McCandlish 擔任此職務。
- Head of Responsible Scaling: Anthropic 正為 Head of Responsible Scaling 一職開設新職位,以協調負責 RSP 合規性與迭代的團隊。
數個內部團隊,包括 Frontier Red Team、Trust & Safety、Security and Compliance、Alignment Science,以及專門的 RSP Team,皆為持續的風險管理流程做出貢獻。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch