Anthropic 负责任缩放政策 3.0 版本
Anthropic 发布了其负责任缩放政策 (RSP) 的 3.0 版本,这是一个旨在随着 AI 能力提升而减轻灾难性风险的自愿性框架。此次更新将政策从严格的“如果-那么”能力阈值转向了一种更务实的方法,区分了 Anthropic 可以单方面实现的目标与需要行业或政府共同采取行动的目标。
结构转变:单方面与多边缓解措施
Anthropic 重构了 RSP,将其内部运营计划与其对整个 AI 行业的更广泛安全建议区分开来。这一变化应对了这样一个现实:某些高层级的安全保障措施是单一公司无法独立实施的。
- 单方面承诺: RSP 现在概述了 Anthropic 将独立于其他行业参与者而追求的具体缓解措施。
- 行业建议: 该政策包含了一份雄心勃勃的能力与缓解措施映射图,旨在作为整个 AI 行业共同管理高级风险的蓝图。
前沿安全路线图
3.0 版本引入了前沿安全路线图 (Frontier Safety Roadmap),这是一份公开文件,详细说明了在四个关键领域:安全、对齐、保障措施和政策方面的雄心勃勃但可实现的目标。虽然这些目标不具约束力,但它们作为内部驱动力以及衡量进展的公开基准。
路线图中的关键目标包括:
- 信息安全: 启动“登月级研发”项目,以实现前所未有的安全水平。
- 自动化红队测试: 开发自动化红队测试方法,其有效性超过人类漏洞赏金参与者。
- 宪法遵循: 实施系统性措施,以确保模型行为符合 Anthropic 的宪法。
- 内部监督: 建立关键开发活动的集中记录,以检测内部威胁(包括人类和 AI)以及安全漏洞。
- 监管指导: 发布政策路线图,提出一种“监管阶梯”,使政策随风险增加而按比例缩放。
风险报告与外部审查
为了提高透明度,Anthropic 正在实施一种系统性的做法,即每 3 到 6 个月发布一次风险报告 (Risk Reports)。这些报告提供了当前模型的全面安全概况,详细说明了能力、威胁模型与活跃缓解措施之间的交集。
外部验证
在特定情况下,RSP 现在要求对这些风险报告进行外部审查。Anthropic 将任命第三方专家——这些专家需无利益冲突且熟悉 AI 安全研究——来查阅未经删减的报告,并使公司的推理和决策过程接受公众审查。虽然当前模型尚未触发此项要求,但 Anthropic 目前正在试点这一流程。
回顾:RSP v1 和 v2 的成功与失败
Anthropic 向 3.0 版本的过渡是基于对其先前政策进行为期两年半的评估结果。
成功之处
- 内部激励: RSP 成功促使了更强有力保障措施的开发,例如用于符合 ASL-3 (AI Safety Level 模式) 标准的输入和输出分类器。
- 行业影响力: 该框架鼓励了包括 OpenAI 和 Google DeepMind 在内的其他实验室采用类似的安全性框架,并为加利福尼亚州 (SB 53)、纽约州 (RAISE Act) 和欧盟 (AI Act 的行为准则) 等司法管辖区的早期 AI 政策提供了参考。
失败之处
能力阈值: “模糊地带”使得很难确定模型何时确切地通过了特定的能力阈值。例如,在生物风险方面,模型可能会通过简单的测试,但无法提供高风险的决定性证据,从而难以就采取行动建立多边案例。
政府节奏: 政府在 AI 安全方面的行动比预期要慢,政治气候往往优先考虑经济增长和竞争力,而非安全监管。
**单方面限制:
- 某些高层级的安全标准(例如 RAND 报告中提到的“SL5”标准)目前被认为在没有国家安全界协助的情况下是无法实现的。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch