Anthropic:針對性人工智慧監管的必要性
Anthropic 主張,隨著人工智慧能力的進步,政府必須在接下來的十八個月內實施針對性的人工智慧政策,以防止災難性風險。該公司認為,審慎且聚焦明確的監管措施可以在不阻礙科學與商業進展的情況下,降低這些風險,避免「反應過度」的監管所帶來的無效與負擔。
網路與CBRN領域風險的加速擴大
數學、推理與程式設計能力的進步,正迅速增加人工智慧被濫用或自主破壞性行為的潛在風險。Anthropic 指出兩個亟需關注的主要領域:
網路能力
在軟體工程任務上的模型表現已大幅提升。根據 SWE-bench 基準測試,能力從 1.96%(Claude 2,2023年10月)提升至 13.5%(Devin,2024年3月),再到 49%(Claude 3.5 Sonnet,2024年10月)。Anthropic 的前沿紅隊報告指出,現有模型已協助執行網路攻擊任務,而下一代模型因具備規劃長時間、多步驟任務的能力,預期將更具效率。
CBRN 風險
人工智慧系統在生物與化學領域已展現專家級知識。英國人工智慧安全研究所發現,部分模型提供的科學答案已與博士級專家相當。這反映在 GPQA 基準測試中最困難部分的分數上,從 2023年11月的 38.8% 提升至 2024年6月的 59.4%(Claude 3.5 Sonnet),再到 2024年9月的 77.3%(OpenAI o1),而人類專家的分數為 81.2%。
負責任擴展政策(RSP)框架
Anthropic 使用負責任擴展政策(RSP)作為一個適應性框架,以識別並減緩災難性風險。RSP 建立在兩個核心原則之上:
- 比例性: 安全與防護措施的強度,隨著模型達到預定的「能力門檻」而逐步加強。
- 迭代性: 持續衡量能力,並根據新發現更新安全策略。
根據 Anthropic 的說法,RSP 為組織帶來三大主要優勢:促使早期投入安全與評估,要求開發具體的威脅模型,並促進對濫用減緩措施的透明度。
有效人工智慧監管的建議原則
Anthropic 建議 RSP 應作為可執行政府監管的原型。他們提出任何有效監管框架應具備三個關鍵要素:
- 透明度: 政府應要求企業為每一世代的新型人工智慧系統公開類似 RSP 的政策與風險評估,並設立機制驗證這些聲明的準確性。
- 激勵安全: 監管應鼓勵發展有效的 RSP。這可透過監管機構識別威脅模型、訂定標準,或比較不同 RSP,以推動「安全競賽」來實現。
- 簡潔與聚焦: 監管必須「精準」,避免不必要的負擔或不合邏輯的規則,以免造成混淆或妨礙災難性風險的預防。
實施與戰略考量
Anthropic 回應了這些監管部署所涉及的幾個戰略問題:
管轄權與範圍
儘管美國聯邦立法是實現統一監管與國際談判的理想途徑,Anthropic 建議若聯邦程序過於緩慢,州級監管可作為必要備用方案。國際上,他們主張共同的安全與防護方法可透過標準化與相互承認,降低全球商業成本。
基於模型 vs. 使用情境監管
Anthropic 反對對通用型模型採取「依使用情境監管」。由於 Claude.ai 或 ChatGPT 之類的模型是通用產品,能執行廣泛任務,因此更實際的做法是監管其基礎模型的根本特性與安全措施,這也是最易監管的點,因為訓練過程資源密集。
對創新與開源的影響
Anthropic 認為,比例適中且具彈性的監管不會顯著阻礙創新。他們指出,安全研究常對一般人工智慧科學產生溢出效益,且強健的安全措施可防止智慧財產外洩。至於開源權重模型,他們主張監管應基於實證測量的風險,而非模型是否共享權重。
Sources
- OriginalThe case for targeted regulation
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch