Anthropic 负责任缩放政策反思

Anthropic 已将其负责任缩放政策 (RSP) 投入运营,旨在将高层级的安全概念转化为管理前沿 AI 模型灾难性风险和滥用的实际指南。该政策为组织优先级、项目时间表和威胁建模建立了结构化框架,以确保安全和保障措施能够随着模型能力的提升而同步扩展。

RSP 的五项高层级承诺

Anthropic 当前的负责任缩放框架建立在五项核心承诺之上,旨在防止在没有充分保障措施的情况下部署具有危险能力的模型:

  1. 建立红线能力:识别并发布在当前安全标准 (ASL-2) 下存储或部署具有过高风险的具体能力。
  2. 针对红线能力进行测试:与领域专家合作设计“前沿风险评估”——通过实证测试来指示模型是否正在接近或已达到红线能力。
  3. 响应红线能力:开发 ASL-3 标准,这是一种更高层级的安全和保障措施。如果 ASL-3 标准无法应用于具有红线能力的模型,Anthropic 承诺将暂停训练或部署。
  4. 迭代扩展:在继续进行 ASL-3 活动之前,Anthropic 将定义该标准的上限,并建立新的红线能力,以触发对 ASL-4 标准的需求。
  5. 保障机制:对评估进行压力测试,对缓解措施进行公开或专家验证,并由董事会和长期利益信托 (Long-Term Benefit Trust) 进行监督。

威胁建模与评估方法论

Anthropic 利用其 Frontier Red Team 和 Alignment Science 团队来识别可能触发 ASL-3 标准的能力。目前,针对达到最近测试模型 4 倍算力的模型,正在网络安全、CBRN (Chemical, Biological, Radiological, and Nuclear) 和模型自主性领域进行测试。

评估方法

Anthropic 采用四种主要方法论来评估模型风险:

  • 问答数据集:执行速度快,但可能受限于受限的格式。
  • 人工试验:通过比较模型辅助对象与使用搜索引擎的对象来衡量滥用情况;这需要稳健的统计推断和专家基准。
  • 自动化任务评估:使用虚拟环境测试自主行为,这需要安全的基础设施和对工具使用的手动审查。
  • 专家红队测试:通过对话记录进行开放式探索,以寻求专家对相关性的意见。

评估中的技术挑战

Anthropic 识别出关于评估可靠性的几个开放性研究问题:

  • 预测性缩放:需要将当前的证据推断至未来的风险水平,以便在达到危险阈值之前准备好缓解措施。
  • 能力提取:确保在测试期间提取出所有相关能力都存在困难,因为诸如提示工程 (prompt engineering) 或微调 (fine-tuning) 等技术可能会解锁隐藏能力。
  • 外部可读性:在寻求更好的证据聚合方式的同时,努力预先指定测试结果,以避免因放宽标准而产生的生产压力。

ASL-3 安全标准

ASL-3 标准旨在降低模型权重被非国家行为体窃取的风险,或模型通过产品界面被滥用的风险。它并不旨在保护模型免受拥有大量资源的国家级行为体的攻击。

产品界面安全

Anthropic 采用“深度防御”方法来防止人为滥用,结合了:

  • 基于人类反馈的强化学习 (RLHF) 和宪法 AI (Constitutional AI)。
  • 多阶段分类器模型,用于检测提示词、生成内容和对话中的滥用行为。
  • 针对越狱 (jailbreaks) 的事件响应和补丁修复。

基础设施与权重安全

为了防御非国家行为体,Anthropic 增加了其安全人员规模,目前约有 8% 的员工在从事与安全相关的领域工作。关键的技术控制措施包括:

  • 多方授权:通过要求多次审批才能访问,来降低数据外泄的风险。
  • 时间限制的访问控制:基于最小权限原则授予临时访问权限。
  • 内部威胁缓解:将内部设备受损视为最高风险向量。

治理与保障结构

为了确保 RSP 执行符合预期,Anthropic 实施了若干监督机制:

  • 中央协调:专门的负责任缩放团队 (Responsible Scaling Team) 管理跨工作流的依赖关系。
  • 对抗性测试:Alignment Stress Testing 团队充当“第二道防线”,对评估和干预措施进行压力测试。
  • 内部报告:非合规报告政策允许员工匿名向负责任缩放官 (Responsible Scaling Officer) 报告疑虑。
  • 外部监督:定期向董事会、长期利益信托 (Long-Term Benefit Trust) 和美国商务部工业与安全局 (U.S. Department of Commerce Bureau of Industry and Security) 提供更新。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch