OpenAI 监管 API 更新:omni-moderation-latest 模型发布
OpenAI 推出了 omni-moderation-latest,这是一款基于 GPT-4o 的新监管模型,使开发者能够更准确地检测有害文本和图像。此更新扩展了 Moderation API 的功能,加入了多模态分类,并显著提升了多语言支持。
多模态有害内容分类
omni-moderation-latest 模型可以评估单独的图像或与文本结合的图像是否包含有害内容。目前多模态支持以下类别:
- 暴力:
violence和violence/graphic - 自残:
self-harm、self-harm/intent和self-harm/instruction - 性内容:
sexual(不包括sexual/minors)
OpenAI 正在努力在未来将多模态支持扩展到更多类别。
扩展的仅文本有害类别
新模型引入了两个仅文本类别,以提升对有害指令的检测:
illicit:检测关于如何实施不法行为的指令或建议(例如,“如何偷窃”。)illicit/violent:检测包含暴力的违法指令。
多语言性能提升
omni-moderation-latest 模型在非英语内容上的准确率相比之前的模型有显著提升。在对 40 种语言的测试中,模型在 98% 的语言上都有改进,并在内部多语言评估中提升了 42%。
关键性能提升包括:
- 低资源语言: 对诸如高棉语或斯瓦蒂语等语言提升了 70%。
- 显著提升: 在泰卢固语(6.4 倍)、孟加拉语(5.6 倍)和马拉地语(4.6 倍)中观察到最大的提升。
- 跨语言等效: 西班牙语、德语、意大利语、波兰语、越南语、葡萄牙语、法语、中文、印尼语和英语的性能现在已超过前一模型仅英文时的表现。
校准概率分数
为了让开发者对监管决策拥有更细粒度的控制,新模型提供了校准分数。这些分数更准确地表示内容违反相关政策的概率,并设计为在未来的监管模型迭代中保持一致。
可用性与集成
omni-moderation-latest 模型通过 Moderation API 对所有开发者免费使用,速率限制基于使用层级。Grammarly、ElevenLabs 等公司已经利用 Moderation API 为 AI 生成的输出和沟通辅助实现安全防护。