OpenAI Moderation API 업데이트: omni-moderation-latest 모델 출시

OpenAI는 omni-moderation-latest를 도입했습니다. 이는 GPT-4o 기반의 새로운 Moderation 모델로, 개발자가 유해한 텍스트와 이미지를 보다 정확하게 감지할 수 있게 합니다. 이번 업데이트는 Moderation API의 기능을 멀티모달 분류와 크게 향상된 다국어 지원을 포함하도록 확장합니다.

멀티모달 유해 분류

omni-moderation-latest 모델은 이미지가 단독이든 텍스트와 결합되든 유해한 콘텐츠를 포함하고 있는지 평가할 수 있습니다. 현재 멀티모달 지원은 다음 카테고리에서 제공됩니다:

  • Violence: violenceviolence/graphic
  • Self-harm: self-harm, self-harm/intent, 및 self-harm/instruction
  • Sexual: sexual (sexual/minors 제외)

OpenAI는 향후 멀티모달 지원을 추가 카테고리로 확대하기 위해 작업 중입니다.

확장된 텍스트 전용 유해 카테고리

새 모델은 유해한 지시를 감지하기 위해 두 개의 새로운 텍스트 전용 카테고리를 도입합니다:

  • illicit: 위법 행위를 수행하는 방법에 대한 지시나 조언을 감지합니다 (예: "how to shoplift").
  • illicit/violent: 특히 폭력을 포함하는 위법 행위 지시를 감지합니다.

다국어 성능 향상

omni-moderation-latest 모델은 이전 모델에 비해 비영어 콘텐츠에 대한 정확도가 크게 향상되었음을 보여줍니다. 40개 언어에 대한 테스트에서 모델은 테스트된 언어의 98%에서 개선되었으며 내부 다국어 평가에서 42% 향상을 보였습니다.

주요 성능 향상은 다음과 같습니다:

  • Low-resource languages: 크메르어, 스와티어와 같은 언어에서 70% 향상.
  • Significant gains: 텔루구어(6.4배), 벵골어(5.6배), 마라티어(4.6배)에서 가장 큰 향상이 관찰되었습니다.
  • Cross-lingual parity: 스페인어, 독일어, 이탈리아어, 폴란드어, 베트남어, 포르투갈어, 프랑스어, 중국어, 인도네시아어, 영어에서의 성능이 이제 이전 모델의 영어 전용 성능을 초과합니다.

보정된 확률 점수

개발자에게 보다 세밀한 Moderation 결정 제어를 제공하기 위해, 새 모델은 보정된 점수를 제공합니다. 이러한 점수는 콘텐츠가 관련 정책을 위반할 확률을 보다 정확하게 나타내며, 향후 Moderation 모델 반복에서도 일관되도록 설계되었습니다.

가용성 및 통합

omni-moderation-latest 모델은 Moderation API를 통해 모든 개발자가 무료로 사용할 수 있으며, 사용량 단계에 따라 속도 제한이 적용됩니다. Grammarly와 ElevenLabs와 같은 기업은 이미 Moderation API를 활용해 AI 생성 출력 및 커뮤니케이션 지원에 대한 안전 가드레일을 구현하고 있습니다.

Sources