人工智能的置信建立措施

OpenAI 和伯克利风险与安全实验室已发布工作坊论文,详细阐述了旨在减轻基础模型对国际安全构成风险的置信建立措施(CBM)。这些措施旨在降低敌意,防止冲突升级,并在全球利益相关方之间建立信任,以避免事故或无意冲突。

基础模型的国际安全风险

基础模型引入了若干可能削弱国家安全的途径。已识别的主要风险包括:

  • 事故和意外升级: AI 驱动的错误可能导致非预期冲突的潜在风险。
  • 非预期冲突: 由于对 AI 能力或意图的误解而产生的风险。
  • 武器扩散: AI 能力促成的武器扩散。
  • 外交干扰: AI 系统对人类外交的干扰。

提出的置信建立措施(CBM)

置信建立措施起源于冷战,是用于降低敌意、增强信任的灵活工具。工作坊参与者确定了六项直接适用于基础模型的具体 CBM。

  1. 危机热线: 建立直接沟通渠道以处理紧急安全问题。
  2. 事件共享: 报告和共享有关 AI 相关安全事件的信息的过程。
  3. 模型、透明度和系统卡: 利用标准化文档,提供模型能力和局限性的清晰说明。
  4. 内容来源和水印: 实施技术标记,以验证内容来源并防止错误信息。
  5. 协作红队演练和桌面演练: 进行联合压力测试以识别模型漏洞。
  6. 数据集和评估共享: 共享用于评估模型安全性和性能的数据和基准。

实施和利益相关方参与

由于大多数基础模型开发者是非政府实体,这些 CBM 的实施不能仅仅依赖于国家间协议。相反,这些措施必须涉及更广泛的利益相关方社区,包括 AI 实验室和政府行为者。这些 CBM 可以由 AI 实验室自身实施,也可以由相关政府机构实施,以确保一个稳定和安全的国际环境。

Sources