Anthropic: 支持针对性 AI 监管的理由
Anthropic 主张,随着 AI 能力的不断提升,政府必须在未来 18 个月内实施针对性的 AI 政策,以防止灾难性风险。该公司断言,审慎且针对性强的监管可以减轻这些风险,而不会阻碍科学和商业的进步,从而避免既无效又沉重的“应激性”监管风险。
网络安全与 CBRN 领域的加速风险
AI 在数学、推理和编程方面的能力正在迅速提升,增加了滥用和自主破坏行为的可能性。Anthropic 确定了两个主要的紧迫关注领域:
网络安全能力
模型在软件工程任务上的表现已显著提升。在 SWE-bench 基准测试中,能力已从 1.96% (Claude 2, October 2023) 增长到 13.5% (Devin, March 2024),并增长到 49% (Claude 3.5 Sonnet, October 2024)。Anthropic 的 Frontier Red Team 报告称,目前的模型已经能够协助网络攻击任务,由于下一代模型具备规划长期的、多步骤任务的能力,预计它们会更加有效。
CBRN 风险
AI 系统正在展示生物学和化学领域的专家级知识。英国 AI Safety Institute 发现,某些模型提供的科学答案与博士级专家相当。这反映在 GPQA 基准测试最难部分的得分上,得分从 38.8% (November 2023) 增长到 59.4% (Claude 3.5 Sonnet, June 2024),并增长到 77.3% (OpenAI o1, September 2024),而人类专家的得分为 81.2%。
负责任的扩展政策 (RSP) 框架
Anthropic 利用负责任的扩展政策 (RSP) 作为一种适应性框架,用于识别和减轻灾难性风险。RSP 基于两个核心原则:
- 比例性: 随着模型达到定义的“能力阈值”,安全和安全措施的强度也会随之增加。
- 迭代性: 定期测量能力,并根据新发现更新安全方法。
根据 Anthropic 的说法,RSP 提供了三个主要的组织益处:它们迫使企业在安全评估方面进行早期投资,要求开发特定的威胁模型,并鼓励在减轻滥用行为方面的透明度。
有效 AI 监管的拟议原则
Anthropic 建议 RSP 应作为可执行政府监管的蓝图。他们为任何有效的监管框架提出了三个关键要素:
- 透明度: 政府应要求公司为每一代新的 AI 系统发布类似 RSP 的政策和风险评估,并建立验证这些声明准确性的机制。
- 激励安全性: 监管应鼓励开发有效的 RSP。这可以通过监管机构识别威胁模型、指定标准或比较不同的 RSP 来实现,从而推动安全实践中的“向顶端竞争”。
- 简单性与专注性: 监管必须是“外科手术式”的,避免不必要的负担或不合逻辑的规则,以免造成混乱或阻碍灾难性风险预防工作的开展。
实施与战略考量
Anthropic 探讨了关于这些监管部署的几个战略问题:
管辖权与范围
虽然美国的联邦立法是实现统一监管和国际谈判的理想工具,但 Anthropic 建议,如果联邦进程过于缓慢,州级监管可以作为必要的后备方案。在国际层面,他们认为共同的安全和安全方法可以通过标准化和相互认可来降低全球商业成本。
基于模型的监管 vs. 基于用例的监管
Anthropic 反对对通用模型进行“基于用例的监管”。因为像 Claude.ai 或 ChatGPT 这样的模型是能够执行广泛任务的通用产品,因此,监管其底层基础模型的根本属性和安全措施更为实际,而且由于其训练过程属于资源密集型,这也是最容易进行监管的点。
对创新与开源的影响
Anthropic 主张,比例且灵活的监管不会显著阻碍创新。他们建议,安全研究通常对通用 AI 科学具有溢出效应,且强大的安全性可以防止知识产权外泄。关于权重开放模型,他们认为监管应基于经验证的风险,而非模型的权重共享状态。 "},
Sources
- OriginalThe case for targeted regulation
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch