Anthropic 将对 Public First Action 的支持增加至 4000 万美元
Anthropic 已向 Public First Action 追加注资 2000 万美元,使其总资助额达到 4000 万美元。这笔资金专门用于公共教育和政策使命,旨在建立合理的 AI 安全保障措施,且不得用于影响联邦、州或地方职位的选举。
加速 AI 能力及其相关风险
AI 模型能力的快速提升正在产生紧迫的安全漏洞,这需要政府立即采取行动。Anthropic 引用了 Claude Mythos Preview 的例子,该模型在每个主要操作系统和浏览器中发现了数千个高严重性软件漏洞。为了降低这些漏洞被利用的风险,Anthropic 通过 Project Glasswing 向有限的网络防御者发布了该模型。
虽然先进模型具有巨大的潜在收益——包括加速药物研发、疾病治疗、科学进步、延长人类寿命和经济增长——但 Anthropic 断言,必须首先建立针对灾难性风险的保护措施,才能实现这些收益。该公司强调,政府需要立即投入时间来建立管理这些风险的能力,同时获取其带来的益处。
前沿 AI 的拟议政策框架
Anthropic 认为,鉴于 AI 发展的速度,仅靠透明度是不够的。该公司倡导一种全面的风险缓解方法,正如《高级 AI 框架》(Advanced AI Framework)中所详述的那样,其中包括以下要求:
- 验证与执行: 政府应有能力验证安全声明,通过民事处罚强制执行安全实践,并阻止部署具有严重灾难性伤害风险的模型。
- 测试与评估: 前沿 AI 开发人员必须针对灾难性风险对模型进行测试,保持研究结果的透明度,将模型提交给独立评估,并运行强大的安全计划。
国家安全与全球 AI 领导地位
为了维持美国及其民主盟友的领导地位,Anthropic 支持特定的国家安全措施,以防止先进技术使威权政权受益。这些拟议措施包括:
- 出口管制: 加强对先进芯片和半导体制造设备的控制。
- 访问限制: 遏制非法模型访问并防止蒸馏攻击(distillation attacks)。
Anthropic 将这些政策框架视为一个起点,并利用其对 Public First Action 的支持来提高围绕 AI 安全和国家安全紧迫政策辩论的显著性。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch