OpenAI 内容审核端点发布

OpenAI 推出了一个新的内容审核端点,为开发者提供免费使用基于 GPT 的分类器,以检测不良内容。该工具通过自动化检测违反安全政策的内容,帮助开发者保护其应用免受滥用。

自动内容分类能力

内容审核端点会分析文本输入,以判断内容是否属于 OpenAI 内容政策禁止的类别。具体而言,工具会评估文本是否属于:

  • 性相关
  • 仇恨
  • 暴力
  • 鼓励自残

该端点在速度和准确性方面进行了优化,以确保在各种应用中的稳健性能,降低大规模部署时 AI 生成内容产生不当输出的风险。此能力使得 AI 能够在对内容安全要求极高的敏感环境(如教育)中使用。

开发者集成与可访问性

OpenAI 将内容审核端点作为免费服务提供,用于审核所有由 OpenAI API 生成的内容。通过提供此基础设施,OpenAI 消除了开发者自行构建和维护自定义分类器的需求,公司将其形容为一项繁琐的工作。

关键集成细节包括:

  • 访问方式: 通过一次 API 调用即可使用。
  • 范围: 目前仅支持 OpenAI API 生成的内容;不支持对第三方流量的监控。
  • 使用案例: OpenAI API 客户 Inworld 使用该端点,确保其基于 AI 的虚拟角色对目标受众保持适当。

研究贡献与透明度

为支持更广泛的 AI 安全生态系统,OpenAI 随同该工具发布了以下资源:

  • 技术论文: 一篇描述开发内容审核端点所用方法论的文档。
  • 评估数据集: 一个包含已在审核类别中标注的 Common Crawl 数据的数据集,以促进内容分类的进一步研究。

Sources