OpenAI 儿童安全与 CSAM 预防策略

OpenAI 正在实施一套全面的安全框架,以防止儿童性虐待材料(CSAM)和儿童性剥削材料(CSEM)的创建和传播。该策略结合了部署前的培训防护、实时监控以及行业合作伙伴关系,以打断利用 AI 进行儿童剥削的尝试。

严格禁令与执行政策

OpenAI 明确禁止将其服务用于任何剥削、危害或性化 18 岁以下个人的活动。这些禁令适用于终端用户以及基于 OpenAI 技术构建的开发者。

禁止的活动

  • CSAM/CSEM: 创建或使用儿童性虐待材料,无论是否为 AI 生成。
  • Grooming and Roleplay: 从事对未成年人的诱导或未成年性/暴力角色扮演。
  • Minor Safety: 让未成年人接触图形化的自残、性或暴力内容;宣传不健康的节食或锻炼;以及羞辱身体类型或外貌。
  • Dangerous Activities: 鼓励未成年人进行危险挑战或提供未成年人获取受年龄限制的商品的途径。

执行措施

  • User Bans: 任何尝试上传或生成 CSAM/CSEM 的用户将被立即封禁,并报告给全国失踪与被剥削儿童中心 (NCMEC)。
  • Developer Accountability: 为未成年人构建工具的开发者必须防止创建性露骨或暗示性内容。OpenAI 会通知开发者其用户的 CSAM/CSEM 尝试;若未能纠正持续的滥用模式,将导致开发者被封禁。
  • Evasion Monitoring: OpenAI 的调查团队会监控试图通过创建新账户规避封禁的用户。

技术防护与检测方法

OpenAI 采用多层次的技术手段,确保模型不能被用于生成或分析剥削性材料。

训练数据完整性

为防止模型具备生成 CSAM 或 CSEM 的能力,OpenAI 检测并移除训练数据集中的此类材料。过程中确认的 CSAM 将报告给 NCMEC。

实时检测与拦截

OpenAI 使用多种技术在生产环境中识别并拦截滥用:

  • Hash Matching: 用于识别内部团队或通过 Thorn 的已审查库标记的已知 CSAM。
  • Content Classifiers: OpenAI 使用 Thorn 的 CSAM 内容分类器来检测可能新出现的 CSAM 上传至其产品。
  • AI-Driven Monitoring: OpenAI 自己的模型被部署用于更快速地检测滥用模式。
  • Human Review: 仅当分类器标记潜在滥用时,内部人工专家才会审查内容。

对新出现的滥用模式的响应

OpenAI 已识别并分享了需要不断演进安全响应的特定滥用模式:

  • Descriptive Analysis: 某些用户尝试上传 CSAM 并要求模型生成对该材料的详细描述。OpenAI 使用哈希匹配和 Thorn 的分类器来拦截这些请求。
  • Narrative Integration: 用户可能尝试通过上传 CSAM 作为叙事的一部分,诱导模型进入涉及未成年人的虚构性角色扮演或虐待情节。

为应对这些,OpenAI 采用上下文感知分类器和滥用监控以及提示级别检测,以确保对误用的强大防御。

公共政策与行业合作

OpenAI 倡导制定公共政策框架,以促进技术公司、执法部门和倡导组织之间更深入的合作。

红队挑战

OpenAI 指出,由于在美国持有 CSAM 是非法的,目前使用 CSAM(即使是模拟材料)对 AI 模型进行“红队”测试也是非法的。这一限制使得彻底验证安全措施变得困难。

立法支持

OpenAI 支持诸如纽约州《儿童性虐待材料预防法》等立法,该法旨在为采取主动检测、分类、监控和减轻有害 AI 生成内容的公司提供法定保护。

Sources