OpenAI 安全实践

OpenAI 概述了十项核心安全实践,以确保行业领先的 AI 模型的开发和部署保持安全可靠。该框架从一开始就将安全措施融入开发过程,从对齐当前模型转向为更强大的未来系统做好准备。

模型评估与风险缓解

OpenAI 在任何发布之前都会进行实证模型红队测试和评估。此过程受“准备度框架”监管,该框架设定了风险阈值。如果新模型的风险评分超过“中等”阈值,则在实施安全干预措施将后期缓解后的得分恢复至“中等”之前,不会发布该模型。

在 GPT-4o 的发布过程中,超过 70 位外部专家参与了红队工作,以识别早期检查点的弱点,这些发现随后用于后续检查点的评估。

对齐与安全研究

安全改进由以下两方面驱动:模型智能的提升——降低事实错误和有害输出的可能性——以及对实用对齐、安全系统和后训练研究的有针对性投入。重点关注的关键领域包括:

  • Fine-tuning data: 提升人工生成数据的质量。
  • Model Specifications: 完善模型训练遵循的指令。
  • Robustness: 开展并发布研究,以提升系统对 jailbreak 等攻击的韧性。

监控与滥用防护

OpenAI 使用广泛的工具监控 API 和 ChatGPT 中的安全风险与滥用行为。这包括使用专用的内容审核模型,并利用 GPT-4 自动化内容政策制定和内容审核决策,从而减少暴露给人工审核员的滥用材料量。

为提升全行业的安全性,OpenAI 与 Microsoft 共同披露了国家行为体对其技术的滥用情况。

生命周期与专项安全关注

OpenAI 在模型的整个生命周期中实施安全措施,从预训练到部署均覆盖。这包括对预训练数据安全、系统层行为引导以及稳健监控基础设施的投入。

高优先级的具体安全领域包括:

儿童安全

OpenAI 已在 ChatGPT 和 DALL·E 中集成默认防护,以降低对儿童的危害。2023 年,公司与 Thorn 的 Safer 项目合作,检测并向美国国家失踪与被拐儿童中心(National Center for Missing and Exploited Children)报告儿童性虐待材料(CSAM),当用户尝试向图像工具上传此类内容时。

选举完整性

为防止滥用并确保透明度,OpenAI 引入了识别 DALL·E 3 图像的工具,并加入 C2PA 元数据,帮助用户辨别媒体来源。此外,ChatGPT 会将用户引导至美国和欧洲的官方投票信息渠道,公司还支持美国参议院的《保护选举免受欺骗性 AI 法案》(Protect Elections from Deceptive AI Act)。

影响评估与安全

OpenAI 进行影响评估,以衡量 AI 相关的风险,包括化学、生物、放射和核(CBRN)风险。公司还研究语言模型对各职业和行业的影响,并分析语言模型在影响行动中的潜在作用。

保护知识产权和数据的安全措施包括:

  • API-based deployment: 通过 API 控制访问,以实现政策执行。
  • Infrastructure security: 基于“需要了解”原则限制对训练环境和算法机密的访问。
  • Cybersecurity programs: 实施内部和外部渗透测试、漏洞赏金计划以及面向第三方研究者的网络安全资助计划(Cybersecurity Grant Program)。
  • Future controls: 探索 GPU 的机密计算以及 AI 驱动的网络防御。

治理与政府合作

OpenAI 与全球各国政府合作,提供 AI 安全政策建议,分享经验并试点第三方保障。

在内部,安全决策通过以下运营结构管理:跨职能的安全咨询小组(Safety Advisory Group)审阅能力报告并提出建议,公司领导层作出最终决定,董事会提供监督。

未来演进

OpenAI 承认,在迈向下一代前沿模型的过程中,必须演进其实践。这包括提升安全姿态,以抵御复杂的国家行为体攻击,并在重大发布前分配更多时间进行安全测试。

Sources