Mistral Moderation API 發佈
Mistral AI 已推出 Mistral Moderation API,這是一款旨在為 AI 部署提供系統級護欄的內容審核工具。此 API 使用與 Le Chat 中的審核服務相同的技術,現在已開放給使用者,以便根據其特定的應用程式安全標準進行調整。
基於 LLM 的分類與功能
Mistral Moderation API 利用經過訓練的 LLM 分類器,將文本輸入分類為九種不同的政策類別。透過利用大型語言模型進行分類,Mistral AI 旨在提供比傳統方法更具擴展性且更強大的審核系統。
多語言支持
該模型原生支持多語言,並針對以下語言進行了特定訓練:
- Arabic
- Chinese
- English
- French
- German
- Italian
- Japanese
- Korean
- Portuguese
- Russian
- Spanish
輸入端點
為了應對不良內容通常取決於上下文的事實,該 API 提供兩個不同的端點:
- Raw Text Endpoint:用於分析獨立的文本輸入。
- Conversational Content Endpoint:用於分析對話上下文中的文本。在這種情況下,模型經過訓練,用於對話的最後一條訊息進行分類。
安全政策與護欄
Moderation API 解決了模型生成的危害,包括防止不合格的建議以及保護個人身份資訊 (PII)。完整的政策定義集可在 Mistral AI 的技術文件中找到。
性能指標
Mistral AI 已根據內部測試集,分享了在各種政策下基於 AUC PR (Area Under the Precision-Recall Curve) 的性能數據。此指標用於評估分類器在九種定義的政策類別中的有效性。
Sources
- OriginalMistral Moderation API
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch