Mistral Moderation API 發佈

Mistral AI 已推出 Mistral Moderation API,這是一款旨在為 AI 部署提供系統級護欄的內容審核工具。此 API 使用與 Le Chat 中的審核服務相同的技術,現在已開放給使用者,以便根據其特定的應用程式安全標準進行調整。

基於 LLM 的分類與功能

Mistral Moderation API 利用經過訓練的 LLM 分類器,將文本輸入分類為九種不同的政策類別。透過利用大型語言模型進行分類,Mistral AI 旨在提供比傳統方法更具擴展性且更強大的審核系統。

多語言支持

該模型原生支持多語言,並針對以下語言進行了特定訓練:

  • Arabic
  • Chinese
  • English
  • French
  • German
  • Italian
  • Japanese
  • Korean
  • Portuguese
  • Russian
  • Spanish

輸入端點

為了應對不良內容通常取決於上下文的事實,該 API 提供兩個不同的端點:

  1. Raw Text Endpoint:用於分析獨立的文本輸入。
  2. Conversational Content Endpoint:用於分析對話上下文中的文本。在這種情況下,模型經過訓練,用於對話的最後一條訊息進行分類。

安全政策與護欄

Moderation API 解決了模型生成的危害,包括防止不合格的建議以及保護個人身份資訊 (PII)。完整的政策定義集可在 Mistral AI 的技術文件中找到。

性能指標

Mistral AI 已根據內部測試集,分享了在各種政策下基於 AUC PR (Area Under the Precision-Recall Curve) 的性能數據。此指標用於評估分類器在九種定義的政策類別中的有效性。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch