Anthropic 负责任缩放政策 (RSP) 框架
Anthropic 已实施了一项负责任缩放政策 (RSP),以管理危险 AI 能力不可预测的出现。该政策建立了一个框架,其中模型的部署和进一步训练取决于特定安全防护措施的实施,这些措施是由模型的实际能力而非其规模或版本触发的。
AI 安全等级 (ASL) 框架
Anthropic 使用 AI 安全等级 (ASL) 系统,根据风险概况对模型进行分类。每个等级都遵循“如果-那么”结构:如果模型表现出某些能力,那么在进一步部署或训练之前必须实施特定的安全防护措施。
ASL-1:低风险
ASL-1 代表几乎没有风险的模型,例如为下棋等任务设计的专用 AI 系统。
ASL-2:现状风险
ASL-2 代表 AI 模型的当前状态。这些模型具有广泛的现状风险,但尚未表现出可能在化学或生物等领域导致灾难性后果的能力。
ASL-2 所需的防护措施:
- Model cards
- 外部红队测试 (External red-teaming)
- 强大的安全措施
ASL-3:灾难性误用风险
当 AI 模型在化学、生物、放射性和核 (CBRN) 领域变得在操作上对灾难性误用有用时,就会触发 ASL-3。
ASL-3 所需的防护措施:
- 足够强大的安全措施,以防止非国家行为体窃取模型权重,并迫使国家行为体必须付出巨大努力才能做到这一点。
- 一项保证,即部署的模型版本绝不会产生在操作上增加 CBRN 风险的信息,即使在接受世界级专家的红队测试时也是如此。
- 在达到 ASL-3 之前,对 ASL-4 的要求进行严格定义。
ASL-4:自主与全球安全风险
当 AI 系统具备接近人类水平的自主能力,或成为严重全球安全威胁(如生物武器)的主要来源时,就会触发 ASL-4。
ASL-4 所需的防护措施:
- 对模型内部运作机制的详细且精确的理解,以提出“肯定性论证”证明模型是安全的。
将 RSP 投入运营
为了确保 RSP 是一个功能性指令而非理论性文件,Anthropic 采用了几种组织策略:
- 高层参与: 该政策由 CEO 和联合创始人投入大量时间参与开发,以向整个组织传达 AI 安全的重要性。
- 集成到路线图中: RSP 协议被视为产品和研究要求。错过 RSP 期限可能会停止新模型的训练或产品的发布。
- 资源分配: Anthropic 已增加了在安全、信任与安全、红队测试和可解释性方面的招聘,以满足 ASL-3 的要求。
问责制与治理
Anthropic 通过多层治理结构确保 RSP 的合规性:
- 董事会监督: RSP 是董事会的正式指令。
- 外部监督: 董事会向长期利益信托 (Long Term Benefit Trust) 负责,这是一个由在公司中没有财务利益的外部专家小组组成的机构。
- 合规机制: 公司正在实施举报人政策,并已任命一名负责 RSP 合规并向长期利益信托报告的官员。
与监管的关系
Anthropic 将 RSP 视为未来政府监管的雏形,而非其替代品。其目标是让公司完善这些框架,并让政府采用其中最好的元素,以创建标准化的测试、审计制度和监督机制。Anthropic 主张“向上的竞争”,即公司和国家共同协作以改进安全框架。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch