Anthropic 负责任扩展政策

Anthropic 已发布其负责任扩展政策(RSP),这是一个技术与组织协议框架,旨在管理日益强大的人工智能系统开发所带来的灾难性风险。该政策确立了一种结构化的方法,仅在相应的安全与保障措施被证明有效时,才允许扩展人工智能能力。

人工智能安全等级(ASL)框架

Anthropic 的 RSP 以人工智能安全等级(ASL)系统为核心,该系统借鉴了美国政府的生物安全等级(BSL)标准。此框架要求安全、安保和运营标准与模型潜在的灾难性风险成比例提升。

ASL 定义与标准

  • ASL-1:不会带来显著灾难性风险的系统,例如 2018 年的大型语言模型(LLM)或专门用于下棋的人工智能系统。
  • ASL-2:表现出危险能力早期迹象的系统(例如,提供制造生物武器的指导),但由于可靠性不足或相关信息已可通过搜索引擎获取,目前尚无实际用途。当前的大型语言模型(包括 Claude)被归类为 ASL-2。
  • ASL-3:与非 AI 基线(如教科书或搜索引擎)相比,显著增加灾难性滥用风险的系统,或表现出低级别自主能力的系统。
  • ASL-4 和 ASL-5+:由于距离当前系统能力尚远,这些等级尚未定义,但预计将涉及自主性和灾难性滥用潜力的质的提升。

安全措施与实施

随着模型在 ASL 等级上提升,安全要求也随之变得更加严格。ASL-2 的措施与 Anthropic 之前向白宫承诺的内容一致。ASL-3 要求更严格的标准,包括增强的安全要求,以及承诺在世界顶级红队人员进行对抗性测试时,若模型表现出显著的灾难性滥用风险,则不进行部署。

对于 ASL-4,Anthropic 承诺在达到 ASL-3 之前定义相关措施。这些措施可能涉及解决当前尚未解决的研究难题,例如使用可解释性方法,从机制上证明模型不太可能产生灾难性行为。

运营与业务影响

RSP 的设计旨在平衡风险缓解与有益人工智能应用的追求。它建立了一种机制:如果人工智能扩展速度超过遵守安全程序的能力,那么对更强大模型的训练可能会暂时暂停。该结构旨在激励解决安全问题,从而解锁进一步扩展。

从商业角度看,RSP 不会改变 Claude 当前的使用或可用性。Anthropic 将该政策比作航空或汽车行业的上市前测试,在产品推向市场前必须严格证明其安全性。

治理与迭代

Anthropic 的 RSP 已获得董事会正式批准,任何政策变更都必须在与长期利益信托(Long Term Benefit Trust)协商后,经董事会批准方可实施。该政策是早期版本,预计随着人工智能领域的发展,将通过快速修正不断演进。

Anthropic 承认 ARC Evals 的影响,特别是其在人工智能风险评估方面的专长,以及在更广泛的 ARC 负责任扩展政策框架开发中的贡献。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch