OpenAI 青少年安全政策包和 gpt-oss-safeguard

OpenAI 发布了一套基于提示的安全政策,旨在帮助开发者为青少年创建适龄保护。这些政策与 gpt-oss-safeguard-20b(一种开源权重安全模型)配合使用,使开发者能够将高层次的安全需求转化为可用于实际 AI 系统的分类器。

通过基于提示的政策实现青少年安全

OpenAI 将这些安全政策以提示的形式提供,可直接与推理模型和 gpt-oss-safeguard 模型一起使用,以确保一致的安全标准。这种方法解决了开发者的主要挑战:将高层次的安全目标转化为精确、可操作的规则,兼顾青少年独特的成长需求和风险。

通过将政策结构化为提示,开发者可以:

  • 更轻松地将安全检查集成到现有工作流中。
  • 将政策适配到特定使用场景。
  • 随时间迭代安全定义。
  • 将这些政策用于实时内容过滤和离线分析用户生成内容。

初始安全政策发布的范围

初始安全政策集合涵盖了针对青少年常见挑战的六大关键风险领域:

  • 图形暴力内容
  • 图形性内容
  • 有害的身体理想和行为
  • 危险活动和挑战
  • 浪漫或暴力角色扮演
  • 年龄受限的商品和服务

专家合作与开发

这些政策在包括 Common Sense Mediaeveryone.ai 在内的外部组织的参与下制定,以细化内容范围、强化提示结构并识别关键边缘案例。

关于这些工具的影响,Common Sense Media 的 AI 与数字评估负责人 Robbie Torney 表示:

“青少年 AI 安全最大的缺口之一是缺乏明确、可操作的政策供开发者构建。许多时候,开发者只能从零开始。这些基于提示的政策帮助在整个生态系统中设定了有意义的安全底线……”

everyone.AI 的首席科学家 Mathilde Cerioli 博士指出,这些政策有助于“将专家知识转化为可在真实系统中使用的指导”。

实施“纵深防御”策略

OpenAI 强调,这些政策是起点而非完整的安全解决方案。由于每个应用都有独特的风险和情境,鼓励开发者采用“纵深防御”方法,将这些基于提示的政策与其他防护措施相结合,包括:

  • 产品设计决策
  • 用户控制
  • 面向青少年的透明度
  • 监控系统
  • 适龄响应

这些已发布的政策基于 OpenAI 的内部经验,但并不代表公司内部防护措施的全部范围。

Sources