Mistral Moderation API 发布

Mistral AI 推出了 Mistral Moderation API,这是一款旨在为 AI 部署提供系统级护栏的内容审核工具。该 API 使用的是与 Le Chat 中的审核服务相同的技术,现在已向用户开放,以便用户根据其特定的应用安全标准进行定制。

基于 LLM 的分类与能力

Mistral Moderation API 利用经过训练的 LLM 分类器,将文本输入分为九个不同的策略类别。通过利用大语言模型进行分类,Mistral AI 旨在提供比传统方法更具扩展性和更稳健的审核系统。

多语言支持

该模型原生支持多语言,并针对以下语言进行了专门训练:

  • Arabic
  • Chinese
  • English
  • French
  • German
  • Italian
  • Japanese
  • Korean
  • Portuguese
  • Russian
  • Spanish

输入端点

为了应对不良内容通常依赖于上下文这一事实,该 API 提供两个不同的端点:

  1. Raw Text Endpoint:用于分析独立的文本输入。
  2. Conversational Content Endpoint:用于分析对话上下文中的文本。在这种情况下,模型经过训练,用于对对话的最后一条消息进行分类。

安全策略与护栏

Mistral Moderation API 旨在解决模型生成的内容带来的危害,包括防止提供不合格的建议以及保护个人身份信息 (PII)。完整的策略定义集可在 Mistral AI 的技术文档中找到。

性能指标

Mistral AI 分享了基于内部测试集在各种策略下基于 AUC PR (Area Under the Precision-Recall Curve) 的性能数据。该指标用于评估分类器在九个定义的策略类别中的有效性。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch