Anthropic 和 Accenture 合作推行为前沿人工智能设计的嵌入式评估

Anthropic 已与 Accenture 合作,实施“嵌入式评估”流程,即独立评估人员在人工智能公司内部工作,以验证安全承诺并评估模型开发。该合作旨在通过向外部专家提供员工级别的训练流程和内部决策访问权限,提高人工智能安全的可验证性。

嵌入式评估模式

嵌入式评估与传统外部评估不同,它赋予独立评估人员相当于员工的访问权限。这种内部视角使评估人员能够:

  • 监控模型开发: 在训练阶段观察模型的构建过程。

  • 审计内部治理: 跟踪决定模型构建和部署方式的决策过程。

  • 直接与员工沟通: 直接与员工交流,识别盲点并评估运营安全性。

  • 公开报告: 报告事件,并向公众提供关于模型风险与收益的更全面信息。

Anthropic 表示,尽管这些评估人员提供验证,但模型安全的最终责任仍由人工智能开发者承担。

合作范围与投资

该合作由 Faculty 领导,Faculty 是 Accenture 的专业人工智能业务部门。工作范围包括评估和红队测试模型、进行对齐评估以及测试模型防护机制。Accenture 在跨行业和政府部署人工智能方面的经验,旨在为评估过程中采用的安全方法提供指导。

Anthropic 和 Accenture 预计在未来五年内各自至少投资 10 亿美元,以在此领域建立能力。

资金与标准化挑战

由于目前尚无针对嵌入式评估人员的信息访问或报告的既定标准,也无既定的资金体系,当前安排如下:

  • 直接资助: 由于该倡议的重要性和紧迫性,Anthropic 将直接资助 Accenture 的工作。

  • 替代资金试点: Anthropic 正与 METR 及其他非营利性评估机构进行对话,试点使用其独立资金开展嵌入式评估。

  • 长期目标: Anthropic 倡导最终资金来自共同池化或政府来源,如其在六月份发布的《先进人工智能框架》中所提议的那样。

生态系统与非排他性

该合作是非排他性的。Anthropic 计划与多个评估机构合作,更多合作方将在未来几周内公布。同样,Accenture 也将以类似方式与其他人工智能开发者合作。目标是随着前沿人工智能领域的发展,建立一个在共同标准下运作的评估机构生态系统。

Sources