OpenAI儿童安全承诺:采用安全设计原则

OpenAI 与包括 Amazon、Anthropic、Civitai、Google、Meta、Metaphysic、Microsoft、Mistral AI 和 Stability AI 在内的行业领袖合作,已采纳安全设计(Safety by Design)原则。该倡议由非营利组织 Thorn 与 All Tech Is Human 主导,旨在主动降低生成式 AI 对儿童的风险,确保在 AI 技术的开发、部署和维护全过程中将儿童安全放在首位。

主动开发儿童安全AI

OpenAI 承诺构建和训练生成式 AI 模型,以主动应对儿童安全风险。此开发阶段聚焦三个主要技术和运营目标:

  • 训练数据完整性: OpenAI 将负责任地获取训练数据集,并积极检测并移除训练数据中的儿童性虐待材料(CSAM)和儿童性剥削材料(CSEM),并向相关部门报告任何确认的 CSAM。
  • 迭代测试: 开发过程结合反馈循环和迭代压力测试策略,以识别漏洞。
  • 对抗性滥用: 公司正在部署专门设计的解决方案,以应对并防止模型的对抗性滥用。

部署与分发保护

为确保在生成式 AI 模型发布和分发期间的安全,OpenAI 承诺采取以下措施:

  • 评估与预防: 模型仅在完成儿童安全训练和评估后才会发布和分发,整个过程均集成了保护措施。
  • 滥用响应: OpenAI 将打击并响应滥用内容和行为,结合预防措施以限制伤害。
  • 开发者所有权: 公司鼓励开发者在以下安全设计原则中承担所有权。

持续维护与风险缓解

OpenAI 通过持续监控和响应新出现的儿童安全风险来维护平台安全。此承诺的关键内容包括:

  • 打击AIG‑CSAM: OpenAI 致力于从其平台上移除由不良行为者生成的 AI 生成的儿童性虐待材料(AIG‑CSAM)。
  • 研究投资: 公司将投资于研究和未来技术解决方案,以打击 CSAM、AIG‑CSAM 和 CSEM。
  • 利益相关者参与: OpenAI 继续与全国失踪与被剥削儿童中心(NCMEC)、技术联盟以及公司的政府和行业利益相关者合作,以加强报告机制和儿童保护议题。

责任与报告

作为该工作组的一部分,OpenAI 及其同行已同意每年发布进展更新,以保持在实施这些安全原则方面的透明度和问责制。

Sources