OpenAI 对 AI 安全的方案

OpenAI 使用多层次的安全框架,以确保强大的 AI 系统安全且广泛有益。该方法结合了严格的部署前测试、迭代的真实世界部署以及持续的对齐研究,以降低风险并改进模型行为。

部署前测试与对齐

OpenAI 在发布任何新系统之前进行严格的测试,并邀请外部专家提供反馈。组织使用诸如人类反馈强化学习(RLHF)等技术来改进模型行为和对齐程度。

针对 GPT-4,OpenAI 在全公司范围内投入了超过六个月的时间,以在公开发布前使模型更安全、更对齐。

迭代部署与真实世界学习

OpenAI 认为实验室测试有其局限,无法预测技术的所有有益或滥用场景。为此,采用了迭代部署策略:

  • 逐步发布: 新的 AI 系统会谨慎地向逐步扩大的用户群发布,并配备充分的安全保障。
  • 滥用监控: 通过将模型以服务和 API 形式提供,OpenAI 能够监测并对滥用行为采取行动,并基于真实世界数据而非理论构建缓解措施。
  • 社会适应: 迭代部署让社会和利益相关者能够在 AI 发展中发挥重要作用,并为技术更有效的采用争取时间。

儿童安全与内容审核

保护儿童是 OpenAI 安全工作的重要重点。组织制定了严格的使用政策,禁止生成仇恨、骚扰、暴力或成人内容。

GPT-4 的关键安全指标包括:

  • 禁用内容: 与 GPT-3.5 相比,GPT-4 对禁用内容请求的响应概率降低了 82%。
  • 儿童安全工具: OpenAI 使用 Thorn 的 Safer 检测、审查并向美国失踪与被拐儿童中心(National Center for Missing and Exploited Children)报告上传至图像工具的儿童性虐待材料(CSAM)。
  • 年龄要求: 用户必须年满 18 岁,或在父母同意下年满 13 岁。

OpenAI 还与 Khan Academy 等合作伙伴合作,为特定使用场景(如面向学生和教师的 AI 助手)开发定制的安全缓解措施。

隐私与数据处理

OpenAI 的大型语言模型在包括公开可用内容、授权内容以及由人工审阅者生成的授权内容的广泛语料库上进行训练。数据用于提升模型的有用性,而非用于出售服务、广告或构建个人画像。

为保护个人隐私,OpenAI 采用了多项策略:

  • 删除个人信息: 在可行的情况下,从训练数据集中移除个人信息。
  • 拒绝引用: 对模型进行微调,使其拒绝提供私人个人信息的请求。
  • 删除请求: 组织会响应个人删除其在系统中个人信息的请求。

事实准确性与幻觉

OpenAI 认识到大型语言模型基于模式预测下一个词序列,这可能导致事实不准确。为提升准确性,OpenAI 利用用户对错误 ChatGPT 输出的反馈作为主要数据来源。

基于该迭代改进过程,GPT-4 生成事实性内容的概率比 GPT-3.5 高出 40%。

全球治理与持续研究

OpenAI 认为全球治理是必要的,以确保在防止公司“投机取巧”抢先的规模上有效监管 AI 发展。OpenAI 积极与各国政府合作,推动将严格的安全评估纳入监管法规。

组织坚持 AI 安全与能力的提升应同步进行,因为更强大的模型更善于遵循指令且更易于引导。OpenAI 将在 AI 系统演进过程中持续加强安全防护,对未来模型的额外安全工作可能需要超过六个月的时间。

Sources