Anthropic 對美國行政命令、G7 行為準則及 Bletchley Park 峰會的分析
Anthropic 已識別出 2023 年底 AI 政策中的三個關鍵事件:美國發布了一項全面的 AI 行政命令、建立了 G7 國際行為準則,以及由英國主導的 Bletchley Park AI 安全峰會。這些事件標誌著全球正轉向協調一致的努力,以評估與監控前沿 AI 系統的安全性、安全保障與可信度。
美國 AI 行政命令
美國行政命令 (EO) 建立了一個全面的框架來應對 AI 風險——包括隱私、公平性、偏見以及災難性風險——同時指示政府機構透過任命首席 AI 官來利用 AI 以改善公共服務。
Anthropic 強調了 EO 中的幾項關鍵技術與結構性指令:
- NIST 賦能:EO 指示美國國家標準暨技術研究院 (NIST) 開發模型能力與安全性的評估方法,擴展安全軟體開發框架以納入前沿模型,並為風險管理框架建立一個生成式 AI 伴侶。
- NAIRR 試點:該命令啟動了國家 AI 研究資源 (NAIRR) 的試點計畫,旨在為學術研究人員提供 AI 安全研究與開發有益應用所需的數據與算力。
G7 國際行為準則
透過廣島程序 (Hiroshima Process) 開發的《G7 開發先進 AI 系統組織國際行為準則》,為在整個 AI 生命週期中識別與緩解風險提供了一套負責任的實踐方法。
此準則建立在先前白宮的自願性承諾之上,並專注於:
- 風險緩解:實施評估、資訊共享、治理、安全程序與透明度措施。
- 監管基準:Anthropic 將此準則視為國際最佳實踐與未來國內法規的潛在基準。
Bletchley Park 峰會與 Bletchley 宣言
英國政府的 AI 安全峰會召集了全球專家與官員以應對前沿 AI 的疑慮,並產生了《Bletchley 宣言》。這份聲明由包括中國與開發中國家在內的 28 個國家簽署,呼籲多方利益相關者採取行動以管理 AI 的風險與益處。
峰會的主要成果包括:
- 國際研究評估:簽署國同意支持對現有前沿 AI 能力與風險研究進行國際評估,以向政府提供科學現狀的資訊。
- 負責任的擴展政策:在峰會期間,Anthropic CEO Dario Amodei 展示了公司的《負責任的擴展政策》作為監管方法的潛在原型,但並非作為正式法規的替代品。
政府 AI 安全研究所的建立
近期政策轉向的一個主要成果是建立了專門的政府機構,致力於 AI 模型的技術評估。
英國 AI 安全研究所
英國的前沿 AI 工作小組已重組為 AI 安全研究所,這是第一個專注於評估前沿 AI 風險的重要政府倡議。 該研究所聘請了技術專家,這些專家已經對包括 Anthropic 在內的實驗室的前沿模型進行了私下測試。
美國 AI 安全倡議
美國正透過 NIST 聯盟啟動一個與英國研究所相應的倡議。該倡議將專注於:
- 評估方法:開發評估 AI 系統安全性與可信度的方法。
- 前沿威脅紅隊演練:NIST 將開發紅隊演練指南,以識別 AI 模型中危險的雙重用途能力。
評估科學的重要性
Anthropic 主張,推進評估科學與建立獨立的測試協定是明智監管的基礎性要求。強大的測量能力讓政府能有效監管 AI,並提供一個客觀的框架,使資源較少的公司能在相同的安全基準上與大型實驗室競爭。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch