Mistral Moderation API 출시
Mistral AI는 AI 배포를 위한 시스템 수준의 가드레일을 제공하도록 설계된 콘텐츠 모더레이션 도구인 Mistral Moderation API를 출시했습니다. 이 API는 Le Chat의 모더레이션 서비스를 구동하는 것과 동일한 기술이며, 이제 사용자가 자신의 특정 애플리케이션 안전 표준에 맞게 조정할 수 있도록 제공됩니다.
LLM 기반 분류 및 기능
Mistral Moderation API는 텍스트 입력을 9가지의 별도 정책 카테고리로 분류하도록 학습된 LLM 분류기를 활용합니다. 분류를 위해 대규모 언어 모델(LLM)을 활용함으로써, Mistral AI는 전통적인 방식에 비해 더 확장 가능하고 강력한 모더레이션 시스템을 제공하는 것을 목표로 합니다.
다국어 지원
이 모델은 기본적으로 다국어를 지원하며, 다음 언어들에 대해 특정 학습이 이루어졌습니다:
- Arabic
- Chinese
- English
- French
- German
- Italian
- Japanese
- Korean
- Portuguese
- Russian
- Spanish
입력 엔드포인트
원치 않는 콘텐츠가 종종 문맥에 따라 달라진다는 점을 해결하기 위해, API는 두 가지 별도의 엔드포인트를 제공합니다:
- Raw Text Endpoint: 독립적인 텍스트 입력을 분석하기 위한 용도입니다.
- Conversational Content Endpoint: 대화 문맥 내의 텍스트를 분석하기 위한 용도입니다. 이 경우, 모델은 대화의 마지막 메시지를 분류하도록 학습되었습니다.
안전 정책 및 가드레일
Moderation API는 부적절한 조언 방지 및 개인정보(PII) 보호를 포함하여 모델 생성 유해성을 다룹니다. 전체 정책 정의 세트는 Mistral AI의 기술 문서에서 확인할 수 있습니다.
성능 지표
Mistral AI는 내부 테스트 세트를 사용하여 다양한 정책에 걸친 AUC PR(Area Under the Precision-Recall Curve) 기반의 성능 데이터를 공유했습니다. 이 지표는 정의된 9가지 정책 카테고리에 걸친 분류기의 효과를 평가하는 데 사용됩니다.
Sources
- OriginalMistral Moderation API
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch