Anthropic 提議的 AI 開發透明度框架
Anthropic 已提議了一項針對性的透明度框架,旨在確保最強大的 AI 系統開發者對公眾安全和問責制負責。在政府、學術界和工業界開發全球安全標準和全面評估方法之際,該框架旨在提供一種過渡性的安全措施。
一種靈活的 AI 法規管理方式
提議的框架旨在保持輕量化和靈活性,以避免阻礙 AI 創新或減緩國家安全、公共利益和藥物研發等領域的效益交付。Anthropic 主張,僵化的政府強制標準可能會適得其反,因為由於技術變革的快速節奏,AI 評估方法往往在幾個月內就會過時。
AI 透明度的最低標準
Anthropic 概述了應引導 AI 透明度政策的六個核心原則,以在適應技術演進特性的同時,增強安全性與公眾安全:
1. 針對大型開發者進行定向應用
透明度要求應僅適用於最大的前沿模型開發者。這些開發者的區別在於與計算能力、計算成本、評估性能、年收入和研發(R&D)相關的閾值。為了保護新創生態系統,該框架建議對較小的開發者進行豁免。潛在閾值的示例包括年收入約 1 億美元,或年度研發與資本支出約 10 億美元。
2. 實施安全開發框架
受規範的開發者必須建立「安全開發框架」以評估和緩解「不合理的風險」。這些風險特別包括由模型自主性失調所造成的傷害,以及化學、生物、放射性及核能(CBRN)傷害的產生。
3. 安全框架的公開披露
安全開發框架必須在 AI 公司維護的面向公眾的網站上披露,並允許對敏感信息進行合理的刪減。公司還必須提供一份自我認證,證明其正在遵守其發布的框架條款。
4. 公開發布系統卡片(System Cards)
開發者必須在部署時公開披露系統卡片或類似文件。這些文件應總結測試程序、評估結果和緩解措施,並允許對可能損害模型或公眾安全與安全的資訊進行刪減。
5. 吹哨者的法律保護
為了確保問責制,該框架提議將實驗室對其自身框架的合規性撒謊定為法律違規行為。這將使現有的吹哨者保護機制能夠適用,並將執法重點放在蓄意的不當行為上。
6. 進化的透明度標準
由於 AI 安全與安全實踐仍處於早期階段,框架必須為進化而設計。要求應從靈活、輕量化的標準開始,隨著利益相關者之間達成共識的最佳實踐出現而進行調整。
行業背景與政策影響
此提議與領先實驗室已採用的現有自願性實踐一致,包括 Anthropic 的 Responsible Scaling Policy 以及來自 Google DeepMind、OpenAI 和 Microsoft 的類似框架。通過將這些要求法制化,該框架將使行業最佳實踐標準化,並確保隨著模型變得更加強大,安全披露無法被撤回。
Anthropic 建議,這些針對系統卡片和安全開發框架的透明度要求,將為政策制定者提供必要的證據,以判斷是否需要進一步、更嚴格的監管,同時為公眾提供有關前沿 AI 技術的重要資訊。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch