Anthropic 負責任擴展政策 (RSP) 框架
Anthropic 已實施負責任擴展政策 (RSP),以管理危險人工智慧能力的不可預測出現。該政策建立了一個框架,其中模型的部署與進一步訓練取決於特定安全防護措施的實施,這些措施由模型的實際能力觸發,而非其規模或版本。
人工智慧安全等級 (ASL) 框架
Anthropic 使用人工智慧安全等級 (ASL) 系統,根據模型的風險特徵對其進行分類。每個等級遵循「若-則」結構:若模型展現出特定能力,則必須在進一步部署或訓練前實施特定防護措施。
ASL-1:低風險
ASL-1 代表風險極低或無風險的模型,例如專門設計用於下棋等任務的專用人工智慧系統。
ASL-2:當前風險
ASL-2 代表當前人工智慧模型的狀態。這些模型具有廣泛的當前風險,但尚未展現出可能導致化學或生物等領域災難性後果的能力。
ASL-2 所需防護措施:
- 模型卡片
- 外部紅隊測試
- 強大的安全措施
ASL-3:災難性濫用風險
當人工智慧模型在化學、生物、放射及核能(CBRN)領域具備實際操作上的濫用價值時,觸發 ASL-3。
ASL-3 所需防護措施:
- 安全措施強度足以防止非國家行為者竊取模型權重,並迫使國家行為者付出巨大努力才能做到。
- 確保部署版本的模型永遠不會產生會實際增加 CBRN 風險的資訊,即使經過世界級專家的紅隊測試亦然。
- 在達到 ASL-3 前,需有嚴謹定義 ASL-4 的要求。
ASL-4:自主與全球安全風險
當人工智慧系統具備接近人類水平的自主性,或成為嚴重全球安全威脅的主要來源(例如生物武器)時,觸發 ASL-4。
ASL-4 所需防護措施:
- 對模型內部運作有詳細且精確的理解,以提出「肯定性論證」證明模型是安全的。
實施 RSP
為確保 RSP 不僅是理論文件,而是可執行的指導方針,Anthropic 採取了多項組織策略:
- 高階參與: 該政策由執行長與共同創辦人投入大量時間制定,以向整個組織傳達人工智慧安全的重要性。
- 整合至發展路徑: RSP 協議被視為產品與研究的必要要求。未達成 RSP 時程將導致新模型訓練或產品發行中止。
- 資源配置: Anthropic 已增加在安全、信任與安全、紅隊測試及可解釋性領域的招聘,以滿足 ASL-3 的要求。
責任與治理
Anthropic 透過多層治理結構確保 RSP 的遵守:
- 董事會監督: RSP 是董事會的正式指令。
- 外部監督: 董事會對「長期利益信托」負責,該外部專家小組與公司無財務利益關係。
- 合規機制: 公司正在實施舉報政策,並任命專責人員負責 RSP 合規,並向長期利益信托報告。
與法規的關係
Anthropic 視 RSP 為未來政府法規的原型,而非其替代品。目標是讓企業精進這些框架,並由政府採納最佳元素,建立標準化測試、審計制度與監督機制。Anthropic 主張推動「向上競爭」,讓企業與國家合作,共同提升安全框架。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch