OpenAI AI治理承诺

全面的红队演练和安全评估

OpenAI 承诺对范围内所有主要公开发布的新模型进行内部和外部红队演练。此过程涉及邀请独立领域专家评估系统在滥用、社会风险和国家安全方面的问题。

具体红队演练的重点领域包括:

  • 生物、化学和放射性风险: 评估系统如何可能降低武器的开发、设计、获取或使用的门槛。
  • 网络能力: 评估系统如何可能帮助漏洞发现、利用或操作使用,同时注意这些能力也可用于防御目的。
  • 系统交互和工具使用: 分析模型控制物理系统的能力。
  • 自我复制: 评估模型自我复制的能力。
  • 社会风险: 应对偏见和歧视。

为了支持这些工作,OpenAI 正在推进 AI 安全研究,特别是决策过程的可解释性以及系统对滥用的鲁棒性。这些安全程序将在透明度报告中披露。

信息共享与标准制定

OpenAI 将致力于在公司和政府之间就信任与安全风险、危险或新兴能力以及规避防护措施的尝试进行信息共享。这包括建立或加入论坛以制定和采用共享标准和最佳实践,例如 NIST AI 风险管理框架。

这些机制将促进前沿能力和新兴威胁信息的共享,并让政府、民间社会和学术界参与,以在关注的优先领域开发技术工作组。

AI 生成内容的识别

为了确保用户能够区分人类生成内容和 AI 生成内容,OpenAI 承诺为其公开可用系统生成的音频和视觉内容开发强大的机制。这包括使用来源和水印系统。

此实施的关键细节包括:

  • 范围: 适用于水印系统开发后引入的音频或视觉内容。
  • 工具: 开发 API 或工具以判断内容是否由其系统创建。
  • 排除: 容易与现实区分的内容(例如,默认 AI 助手声音)不在范围内。
  • 数据: 水印或来源数据将包含模型或服务标识符,但不包含用户身份信息。

OpenAI 还承诺与行业同行和标准制定机构合作,开发一个技术框架,以区分 AI 生成内容和用户生成内容。

透明度与公开报告

OpenAI 承诺为范围内所有新重大模型公开发布发布报告。这些报告将详细说明:

  • 安全评估: 安全评估结果,包括危险能力,前提是负责任地公开披露。
  • 性能限制: 性能上的重大限制,对适用领域有影响。
  • 适当使用: 适当和不适当使用的领域。
  • 社会风险: 关于模型对公平和偏见影响的讨论。
  • 对抗性测试: 对抗性测试结果,用于评估模型部署的适用性。

社会风险缓解与全球挑战

OpenAI 优先研究社会风险,包括避免有害偏见和歧视以及保护隐私。这包括赋能信任与安全团队和保护儿童,以主动管理 AI 风险。

此外,OpenAI 同意支持前沿 AI 系统的研究与开发,以应对全球挑战,例如:

  • 气候变化缓解与适应。
  • 早期癌症检测与预防。
  • 网络安全: 抵御网络威胁。

OpenAI 还承诺支持教育和培训倡议,以帮助学生和工人从 AI 中受益,并帮助公众理解该技术的影响。

Sources