Anthropic 對美國行政命令、G7 行為準則及 Bletchley Park 峰會的分析

Anthropic 已識別出 2023 年底 AI 政策中的三個關鍵事件:美國發布了一項全面的 AI 行政命令、建立了 G7 國際行為準則,以及由英國主導的 Bletchley Park AI 安全峰會。這些事件標誌著全球正轉向協調一致的努力,以評估與監控前沿 AI 系統的安全性、安全保障與可信度。

美國 AI 行政命令

美國行政命令 (EO) 建立了一個全面的框架來應對 AI 風險——包括隱私、公平性、偏見以及災難性風險——同時指示政府機構透過任命首席 AI 官來利用 AI 以改善公共服務。

Anthropic 強調了 EO 中的幾項關鍵技術與結構性指令:

  • NIST 賦能:EO 指示美國國家標準暨技術研究院 (NIST) 開發模型能力與安全性的評估方法,擴展安全軟體開發框架以納入前沿模型,並為風險管理框架建立一個生成式 AI 伴侶。
  • NAIRR 試點:該命令啟動了國家 AI 研究資源 (NAIRR) 的試點計畫,旨在為學術研究人員提供 AI 安全研究與開發有益應用所需的數據與算力。

G7 國際行為準則

透過廣島程序 (Hiroshima Process) 開發的《G7 開發先進 AI 系統組織國際行為準則》,為在整個 AI 生命週期中識別與緩解風險提供了一套負責任的實踐方法。

此準則建立在先前白宮的自願性承諾之上,並專注於:

  • 風險緩解:實施評估、資訊共享、治理、安全程序與透明度措施。
  • 監管基準:Anthropic 將此準則視為國際最佳實踐與未來國內法規的潛在基準。

Bletchley Park 峰會與 Bletchley 宣言

英國政府的 AI 安全峰會召集了全球專家與官員以應對前沿 AI 的疑慮,並產生了《Bletchley 宣言》。這份聲明由包括中國與開發中國家在內的 28 個國家簽署,呼籲多方利益相關者採取行動以管理 AI 的風險與益處。

峰會的主要成果包括:

  • 國際研究評估:簽署國同意支持對現有前沿 AI 能力與風險研究進行國際評估,以向政府提供科學現狀的資訊。
  • 負責任的擴展政策:在峰會期間,Anthropic CEO Dario Amodei 展示了公司的《負責任的擴展政策》作為監管方法的潛在原型,但並非作為正式法規的替代品。

政府 AI 安全研究所的建立

近期政策轉向的一個主要成果是建立了專門的政府機構,致力於 AI 模型的技術評估。

英國 AI 安全研究所

英國的前沿 AI 工作小組已重組為 AI 安全研究所,這是第一個專注於評估前沿 AI 風險的重要政府倡議。 該研究所聘請了技術專家,這些專家已經對包括 Anthropic 在內的實驗室的前沿模型進行了私下測試。

美國 AI 安全倡議

美國正透過 NIST 聯盟啟動一個與英國研究所相應的倡議。該倡議將專注於:

  • 評估方法:開發評估 AI 系統安全性與可信度的方法。
  • 前沿威脅紅隊演練:NIST 將開發紅隊演練指南,以識別 AI 模型中危險的雙重用途能力。

評估科學的重要性

Anthropic 主張,推進評估科學與建立獨立的測試協定是明智監管的基礎性要求。強大的測量能力讓政府能有效監管 AI,並提供一個客觀的框架,使資源較少的公司能在相同的安全基準上與大型實驗室競爭。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch