OpenAI 審核 API 更新:omni-moderation-latest 模型發布
OpenAI 已推出 omni-moderation-latest,這是一個基於 GPT-4o 的新審核模型,可讓開發者更精確地偵測有害文字與影像。此更新擴充了審核 API 的功能,加入多模態分類,並大幅提升多語言支援。
多模態有害內容分類
omni-moderation-latest 模型能評估單獨的影像或與文字結合的影像是否包含有害內容。多模態支援目前涵蓋以下類別:
- 暴力:
violenceandviolence/graphic - 自我傷害:
self-harm,self-harm/intent, andself-harm/instruction - 性相關:
sexual(excludingsexual/minors)
OpenAI 正在努力於未來將多模態支援擴展至其他類別。
擴充的純文字有害類別
新模型引入兩個純文字類別,以提升對有害指示的偵測能力:
illicit:偵測有關如何犯罪的指示或建議(例如,「如何偷竊」)。illicit/violent:偵測特別包含暴力的犯罪指示。
多語言效能提升
omni-moderation-latest 模型相較於先前的模型,在非英語內容的準確度上顯著提升。在 40 種語言的測試中,模型在 98% 的語言上都有提升,且在內部多語言評估中提升了 42%。
關鍵效能提升包括:
- 資源匱乏語言: 如高棉語或斯瓦蒂語等語言提升了 70%。
- 顯著提升: 最大的提升出現在泰盧語(6.4 倍)、孟加拉語(5.6 倍)和馬拉地語(4.6 倍)。
- 跨語言等效: 西班牙語、德語、義大利語、波蘭語、越南語、葡萄牙語、法語、中文、印尼語以及英語的表現現在已超過先前模型僅英語的表現。
校準機率分數
為了讓開發者對審核決策擁有更細緻的控制,新模型提供校準過的分數。這些分數更精確地表示內容違反相關政策的機率,且設計上在未來的審核模型迭代中保持一致。
可用性與整合
omni-moderation-latest 模型可透過審核 API 免費供所有開發者使用,速率限制依使用層級而定。Grammarly 與 ElevenLabs 等公司已經使用審核 API 為 AI 生成的輸出與通訊協助實作安全防護。