Anthropic 负责任缩放政策更新
Anthropic 更新了其负责任缩放政策 (RSP),这是一个旨在减轻前沿 AI 系统灾难性风险的风险治理框架。此次更新引入了一种更灵活的方法来评估和管理风险,确保安全和保障措施能够随着所开发模型的性能提升而按比例缩放。
比例保障措施与 AI 安全等级 (ASL)
Anthropic 采用 AI 安全等级 (ASL) 标准体系,这是一套分级的安全和保障措施。随着模型能力的增长,这些标准的严格程度也会随之增加,类似于生物研究中使用的生物安全等级。
目前,所有 Anthropic 模型都在 ASL-2 标准下运行,公司表示这反映了当前的行业最佳实践。更新后的政策定义了两个主要的性能阈值,一旦达到这些阈值,将触发向更高 ASL 标准的过渡:
- 自主 AI 研究与开发: 如果一个模型能够独立进行通常需要人类专业知识的复杂 AI 研究任务,Anthropic 要求提高安全标准(可能达到 ASL-4 或更高)并提供额外的安全保证。
- 化学、生物、放射性及核武器 (CBRN) 武器: 如果一个模型能够为具有基本技术背景的个人在创建或部署 CBRN 武器方面提供实质性帮助,公司将要求 ASL-3 标准,其中包括增强的安全控制和部署控制。
ASL-3 保障措施与部署控制
当模型达到 ASL-3 阈值时,Anthropic 会实施多层方法来防止滥用。安全措施包括对模型权重的更强大保护以及更严格的内部访问控制。部署保障措施包括:
- 实时和异步监控。
- 快速响应协议。
- 快速的部署前红队测试。
实施、监督与治理
为确保 RSP 有效执行,Anthropic 建立了若干运营流程:
- 能力评估: 根据定义的性能阈值,进行常规评估以确定当前的保障措施是否仍然适用。
- 保障措施评估: 定期评估以验证安全和部署安全措施是否达到要求的 ASL 标准。
- 文档记录: 使用高可靠性行业中常见的安全案例方法论,对评估和决策过程进行记录。
- 内部与外部审查: 该框架由内部压力测试、安全问题的内部报告流程以及征求外部专家反馈来提供支持。
从初始实施中吸取的教训
在实施原始 RSP 一年后,Anthropic 识别出了若干程序上的不足,包括评估完成时间比计划晚了三天,以及对占位符评估缺乏清晰度。公司得出结论,认为这些情况构成的风险极小,但凸显了在政策中需要更大的灵活性,并需要改进合规性跟踪。
组织架构变更与领导层
Anthropic 更新了其领导层角色以管理 RSP 的缩放:
- 负责任缩放官 (Responsible Scaling Officer): 联合创始人兼首席科学官 Jared Kaplan 接替 Sam McCandlish 担任此职。
- 负责任缩放负责人 (Head of Responsible Scaling): Anthropic 正在设立一个全新的职位——负责任缩放负责人,以协调负责 RSP 合规性与迭代的团队。
包括 Frontier Red Team、Trust & Safety、Security and Compliance、Alignment Science 以及专门的 RSP Team 在内的多个内部团队,都在为持续的风险管理过程做出贡献。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch