Anthropic 第三方測試 AI 政策提案
TL;DR
Anthropic 主張為前沿 AI 系統建立第三方測試機制,以驗證安全聲明並防止社會危害。此方法旨在建立一個廣泛受信任的監督基礎設施,涉及產業、政府與學術界,以管理單靠自我治理無法解決的風險。
第三方監督的必要性
前沿 AI 系統——需要大量運算資源的大規模生成式模型——扮演著「萬能機器」的角色,可以被調整以適應眾多下游使用案例。由於這些系統繼承了基礎模型的性能與弱點,它們無法簡單地套用現有的特定領域監管框架。
Anthropic 主張,雖然自我治理框架(例如其自身的 Responsible Scaling Policy (RSP))至關重要,但它們是不夠的,因為這些框架依賴於單一私人行為者的決策。建立穩健的第三方機制是必要的,以進行:
- 驗證安全性: 提供模型行為在選舉完整性、有害歧視與國家安全誤用方面的獨立驗證。
- 防止災難性事故: 識別突現的自主行為,例如在程式碼中植入漏洞或與人類意圖相悖的行動。
- 避免「膝跳反應式」監管: 主動設計有效的監管,以防止可能導致窒息性且無效立法反應的大型事件發生。
穩健測試機制的框架
有效的測試機制必須精確界定範圍,僅適用於運算密集度最高的大規模系統,以避免對較小型公司造成不利影響。Anthropic 提出以下結構性組成部分:
兩階段測試流程
- 自動化階段: 一個快速、廣泛的測試階段,偏向於避免偽陰性,以便快速發現潛在問題。
- 專家階段: 一個徹底的二次測試,針對標記出的問題利用專家主導的引導技術進行驗證。
多樣化的測試生態系統
測試應由多種參與者進行,以確保合法性與競爭力:
- 私人公司: 分包公司(例如 Gryphon Scientific)或類似於金融會計領域使用的審計公司。
- 大學: 管理測試計畫的學術機構,可能由政府機構監督。
- 政府: 針對特定且法律規定的領域進行直接測試,特別是涉及機密國家安全風險的領域。
實施的關鍵要求
- 共享標準: 產業、政府與學術界對於安全測試框架應包含哪些內容達成共識。
- 政府資助: 增加政府機構(例如 NIST, US AI Safety Institute)的資源,以資助建立與分析測試的技術工作。
- 公共基礎設施: 建立「國家研究雲端」以允許學術界與政府開發獨立的能力,來研究與測試前沿系統。
國家安全與高風險能力
Anthropic 識別出國家安全是第三方測試至關重要的主要領域。具體而言,系統應針對可能危害國家安全的性能進行測試,例如加速生物武器的製造或執行複雜的網路攻擊。如果發現此類能力,Anthropic 建議採取緩解措施,例如從廣泛部署的模型中移除該能力,或實施「了解您的客戶」(KYC) 機制。
處理開源模型與監管俘獲
公開發布的模型
Anthropic 承認開源研究的價值,但認為隨著模型能力增強,完全公開發布的文化可能與社會安全產生衝突。他們提出,如果一個模型是公開發布的,它必須對可能導致誤用的微調具有韌性。第三方測試被視為定義不可接受的誤用行為,並將這些標準一致地應用於專有模型與開源權重模型(open-weight models)的唯一合法方式。
緩解監管俘獲
為了防止資源充足的 AI 公司利用監管來扼制競爭,Anthropic 主張建立獨立於大型企業之外的測試能力。透過專注於衡量與第三方能力,而非高成本的合規性聯盟,該政策旨在為較小型開發者維持公平的競爭環境。
Anthropic 對支持的承諾
為了協助開發此機制,Anthropic 承諾:
- 透過其 Responsible Scaling Policy (RSP) 建立測試機制的原型。
- 透過承包商與政府合作夥伴進行第三方評估測試。
- 擴展前沿紅隊測試(red teaming)以釐清風險與緩解措施。
- 倡導政府資助 NIST 等機構,並開發國家研究基礎設施。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch