OpenAI 審核 API 更新:omni-moderation-latest 模型發布

OpenAI 已推出 omni-moderation-latest,這是一個基於 GPT-4o 的新審核模型,可讓開發者更精確地偵測有害文字與影像。此更新擴充了審核 API 的功能,加入多模態分類,並大幅提升多語言支援。

多模態有害內容分類

omni-moderation-latest 模型能評估單獨的影像或與文字結合的影像是否包含有害內容。多模態支援目前涵蓋以下類別:

  • 暴力: violence and violence/graphic
  • 自我傷害: self-harm, self-harm/intent, and self-harm/instruction
  • 性相關: sexual (excluding sexual/minors)

OpenAI 正在努力於未來將多模態支援擴展至其他類別。

擴充的純文字有害類別

新模型引入兩個純文字類別,以提升對有害指示的偵測能力:

  • illicit:偵測有關如何犯罪的指示或建議(例如,「如何偷竊」)。
  • illicit/violent:偵測特別包含暴力的犯罪指示。

多語言效能提升

omni-moderation-latest 模型相較於先前的模型,在非英語內容的準確度上顯著提升。在 40 種語言的測試中,模型在 98% 的語言上都有提升,且在內部多語言評估中提升了 42%。

關鍵效能提升包括:

  • 資源匱乏語言: 如高棉語或斯瓦蒂語等語言提升了 70%。
  • 顯著提升: 最大的提升出現在泰盧語(6.4 倍)、孟加拉語(5.6 倍)和馬拉地語(4.6 倍)。
  • 跨語言等效: 西班牙語、德語、義大利語、波蘭語、越南語、葡萄牙語、法語、中文、印尼語以及英語的表現現在已超過先前模型僅英語的表現。

校準機率分數

為了讓開發者對審核決策擁有更細緻的控制,新模型提供校準過的分數。這些分數更精確地表示內容違反相關政策的機率,且設計上在未來的審核模型迭代中保持一致。

可用性與整合

omni-moderation-latest 模型可透過審核 API 免費供所有開發者使用,速率限制依使用層級而定。Grammarly 與 ElevenLabs 等公司已經使用審核 API 為 AI 生成的輸出與通訊協助實作安全防護。

Sources