Mistral Moderation API 发布
Mistral AI 推出了 Mistral Moderation API,这是一款旨在为 AI 部署提供系统级护栏的内容审核工具。该 API 使用的是与 Le Chat 中的审核服务相同的技术,现在已向用户开放,以便用户根据其特定的应用安全标准进行定制。
基于 LLM 的分类与能力
Mistral Moderation API 利用经过训练的 LLM 分类器,将文本输入分为九个不同的策略类别。通过利用大语言模型进行分类,Mistral AI 旨在提供比传统方法更具扩展性和更稳健的审核系统。
多语言支持
该模型原生支持多语言,并针对以下语言进行了专门训练:
- Arabic
- Chinese
- English
- French
- German
- Italian
- Japanese
- Korean
- Portuguese
- Russian
- Spanish
输入端点
为了应对不良内容通常依赖于上下文这一事实,该 API 提供两个不同的端点:
- Raw Text Endpoint:用于分析独立的文本输入。
- Conversational Content Endpoint:用于分析对话上下文中的文本。在这种情况下,模型经过训练,用于对对话的最后一条消息进行分类。
安全策略与护栏
Mistral Moderation API 旨在解决模型生成的内容带来的危害,包括防止提供不合格的建议以及保护个人身份信息 (PII)。完整的策略定义集可在 Mistral AI 的技术文档中找到。
性能指标
Mistral AI 分享了基于内部测试集在各种策略下基于 AUC PR (Area Under the Precision-Recall Curve) 的性能数据。该指标用于评估分类器在九个定义的策略类别中的有效性。
Sources
- OriginalMistral Moderation API
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch