OpenAI 红队网络

OpenAI 已建立红队网络,以将多样化的外部领域专业知识整合到其 AI 模型的安全评估中。此举将 OpenAI 从一次性的外部合作转变为一个持续的、正式的可信专家社区,这些专家在模型和产品开发生命周期的各个阶段为风险评估和缓解提供信息。

正式化 AI 风险评估

OpenAI 红队网络旨在成为学科专家的永久资源,而不是在主要发布前进行的一系列孤立测试。这种结构使得安全流程能够获得更多的迭代和持续输入。

网络的主要特点包括:

  • 迭代部署: 红队工作被视为迭代部署过程的核心部分,建立在之前与外部专家为 GPT-4 和 DALL·E 2 等模型所做的工作之上。
  • 灵活参与: 根据具体项目的需求,成员会因其特定专长被召集。时间投入具有灵活性,每年可能仅需 5–10 小时。
  • 协作环境: 在特定委托活动之外,成员可以相互交流,分享发现和一般的红队实践。
  • 互补方法: 该网络与其他安全措施并行运作,包括第三方审计、研究人员访问计划和开源评估。

目标领域专业知识

OpenAI 正在优先考虑地理和领域多样性,以确保 AI 系统能够从广泛的视角和生活经验中进行评估。该网络寻求广泛领域的专家,包括但不限于:

  • 科学与技术: 生物学、化学、物理学、计算机科学、网络安全和生物识别。
  • 社会科学: 政治学、经济学、社会学、心理学、人类学和认知科学。
  • - 法律与政策: 法律、医疗、金融和政治使用。
  • 伦理与安全: 公平与偏见、对齐、儿童安全、隐私以及错误/虚假信息。
  • 交流: 语言、语言学、说服和隐写术。

成为成员不需要先前的 AI 系统经验,因为主要价值在于专家所带来的特定领域视角,用于评估 AI 的影响。

报酬与保密

参与红队网络是一项有偿活动。然而,由于红队工作通常涉及测试预发布或敏感功能,参与者通常需要签署保密协议(NDAs)。虽然成员身份本身不会限制成员发表自己独立研究的能力,但特定项目的参与将保密无限期。

替代的安全贡献途径

对于不在红队网络中的个人,OpenAI 提供了其他贡献 AI 安全的途径:

开源评估(Evals)

OpenAI 的开源 Evals 仓库为社区提供了进行安全评估的模板。现有评估的示例包括:

  • 说服: 测试 AI 是否能欺骗另一个 AI 说出一个秘密词(MakeMeSay)或说服其捐款(MakeMePay)。
  • 隐写术: 测试 AI 是否能在不被发现的情况下传递秘密消息,或在没有直接通信的情况下进行协调(谢林点)。

研究人员访问计划

该计划提供积分,以支持研究负责任地部署 AI 以及降低相关风险的研究者。

Sources