Anthropic 对美国行政命令、G7 行动准则及 Bletchley Park 峰会的分析
Anthropic 识别出 2023 年底 AI 政策领域的三个关键事件:美国发布了一项全面的 AI 行政命令、建立了 G7 国际行动准则,以及由英国领导的在 Bletchley Park 举行的 AI 安全峰会。这些事件标志着全球正转向协调一致的努力,以评估和监测前沿 AI 系统的安全性、安全性和可靠性。
美国 AI 行政命令
美国行政命令 (EO) 建立了一个全面的框架来应对 AI 风险——包括隐私、公平性、偏见和灾难性风险——同时指示政府机构通过任命首席 AI 官员来利用 AI 改进公共服务。
Anthropic 强调了该 EO 中的几项关键技术和结构性指令:
- NIST 赋能:EO 指示国家标准与技术研究院 (NIST) 开发针对模型能力和安全性的评估,扩展安全软件开发框架以包含前沿模型,并为风险管理框架创建一个生成式 AI 伴侣。
- NAIRR 试点:该命令启动了国家 AI 研究资源 (NAIRR) 的试点,旨在为学术研究人员提供 AI 安全研究和有益应用开发所需的数据和算力。
G7 国际行动准则
通过广岛进程开发的《G7 开发先进 AI 系统组织国际行动准则》为在整个 AI 生命周期中识别和缓解风险提供了一套负责任的做法。
该准则建立在之前白宫自愿承诺的基础上,并侧重于:
- 风险缓解:实施评估、信息共享、治理、安全程序和透明度措施。
- 监管基准:Anthropic 将该准则视为国际最佳实践和未来国内法规的潜在基准。
Bletchley Park 峰会与 Bletchley 宣言
英国政府举办的 AI 安全峰会召集了全球专家和官员,以应对前沿 AI 的担忧,并产生了《Bletchley 宣言》。该声明由包括中国和发展中国家在内的 28 个国家签署,呼吁多方利益相关者采取行动来管理 AI 的风险和收益。
峰会的主要成果包括:
- 国际研究评估:签署国同意支持对现有关于前沿 AI 能力和风险的研究进行国际评估,以向政府提供科学现状的参考。
- 负责任的扩展策略:在峰会期间,Anthropic CEO Dario Amodei 展示了公司的《负责任的扩展策略》作为监管方法的潜在原型,尽管这并非旨在取代正式的监管。
政府 AI 安全研究所的建立
近期政策转变的一个主要成果是创建了专门致力于 AI 模型技术评估的政府机构。
英国 AI 安全研究所
英国的前沿 AI 任务组已被重组为 AI 安全研究所,这是第一个专注于评估前沿 AI 风险的重要政府倡议。 该研究所雇佣了技术专家,这些专家已经对包括 Anthropic 在实验室的前沿模型进行了私下测试。
美国 AI 安全倡议
美国正通过 NIST 财团启动一个与英国研究所配套的倡议。该倡议将侧重于:
- 评估方法:开发评估 AI 系统安全性与可靠性的方法。
- 前沿威胁红队测试:NIST 将开发红队测试指南,以识别 AI 模型中危险的双用途能力。
评估科学的重要性
Anthropic 断言,推进评估科学并建立独立的测试协议是明智监管的基础性要求。强大的测量能力允许政府有效地监测 AI,并提供一个客观的框架,使资源较少的公司能够在相同的安全基准上与大型实验室进行竞争。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch