OpenAI 监管 API 更新:omni-moderation-latest 模型发布

OpenAI 推出了 omni-moderation-latest,这是一款基于 GPT-4o 的新监管模型,使开发者能够更准确地检测有害文本和图像。此更新扩展了 Moderation API 的功能,加入了多模态分类,并显著提升了多语言支持。

多模态有害内容分类

omni-moderation-latest 模型可以评估单独的图像或与文本结合的图像是否包含有害内容。目前多模态支持以下类别:

  • 暴力: violenceviolence/graphic
  • 自残: self-harmself-harm/intentself-harm/instruction
  • 性内容: sexual(不包括 sexual/minors

OpenAI 正在努力在未来将多模态支持扩展到更多类别。

扩展的仅文本有害类别

新模型引入了两个仅文本类别,以提升对有害指令的检测:

  • illicit:检测关于如何实施不法行为的指令或建议(例如,“如何偷窃”。)
  • illicit/violent:检测包含暴力的违法指令。

多语言性能提升

omni-moderation-latest 模型在非英语内容上的准确率相比之前的模型有显著提升。在对 40 种语言的测试中,模型在 98% 的语言上都有改进,并在内部多语言评估中提升了 42%。

关键性能提升包括:

  • 低资源语言: 对诸如高棉语或斯瓦蒂语等语言提升了 70%。
  • 显著提升: 在泰卢固语(6.4 倍)、孟加拉语(5.6 倍)和马拉地语(4.6 倍)中观察到最大的提升。
  • 跨语言等效: 西班牙语、德语、意大利语、波兰语、越南语、葡萄牙语、法语、中文、印尼语和英语的性能现在已超过前一模型仅英文时的表现。

校准概率分数

为了让开发者对监管决策拥有更细粒度的控制,新模型提供了校准分数。这些分数更准确地表示内容违反相关政策的概率,并设计为在未来的监管模型迭代中保持一致。

可用性与集成

omni-moderation-latest 模型通过 Moderation API 对所有开发者免费使用,速率限制基于使用层级。Grammarly、ElevenLabs 等公司已经利用 Moderation API 为 AI 生成的输出和沟通辅助实现安全防护。

Sources