Mistral AI Voxtral 发布

Mistral AI 推出了 Voxtral,这是一系列前沿的语音理解模型,旨在弥合低精度开源自动语音识别(ASR)系统与昂贵专有 API 之间的差距。Voxtral 提供高精度转录和原生语义理解能力,包含两种尺寸——适用于生产规模应用的 24B 版本和适用于本地及边缘部署的 3B 版本,两者均采用 Apache 2.0 许可证发布。

核心功能与技术规格

Voxtral 模型将语音处理与 Mistral Small 3.1 和 Ministral 后端的文本理解能力相结合。这使得模型无需串联独立的自动语音识别(ASR)和语言模型即可执行复杂任务。

音频处理与上下文

  • 上下文窗口: Voxtral 支持 32k 标记的上下文长度,可转录长达 30 分钟的音频文件,并理解长达 40 分钟的音频内容。
  • 原生多语言支持: 模型具备自动语言检测功能,在广泛使用的语言中表现优异,包括英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语。

功能特性

  • 集成问答与摘要生成: 用户可直接针对音频内容提问或原生生成结构化摘要。
  • 直接函数调用: Voxtral 可根据用户语音意图触发后端函数、工作流或 API 调用,无需中间解析步骤。
  • 文本处理能力: 由于保留了其语言模型后端的能力,Voxtral 模型可作为 Mistral Small 3.1 和 Ministral 的即插即用替代品。

性能基准测试

与开源和专有替代方案相比,Voxtral 在转录和音频理解任务中均表现出卓越性能。

语音转录

Voxtral 在所有评估任务中均优于 Whisper large-v3、GPT-4o mini Transcribe 和 Gemini 2.5 Flash。它在英语短文本转录和 Mozilla Common Voice 15.1 基准测试中达到最先进水平。在 FLEURS 基准测试中,Voxtral Small 在每个任务上均优于 Whisper,并在多种欧洲语言中达到最先进性能。

音频理解与翻译

Voxtral Small 在音频理解任务中与 GPT-4o-mini 和 Gemini 2.5 Flash 竞争力相当。它还在 FLEURS-Translation 基准测试的语音翻译任务中达到最先进水平。

部署与定价

Voxtral 通过多种渠道提供,以满足不同的部署需求:

  • 本地部署: 24B 和 3B 模型均可通过 Hugging Face 下载。
  • API 访问: 专为转录优化的版本 Voxtral Mini Transcribe 已通过 Mistral AI API 上线,起价为每分钟 0.001 美元。Mistral AI 声称该版本性能优于 OpenAI Whisper,且成本不到其一半。
  • Le Chat: Voxtral 正在集成至 Le Chat 的语音模式,供网页和移动用户使用。

企业级与未来路线图

对于企业用户,Mistral AI 提供私有生产级部署、特定领域微调(例如法律或医疗场景)以及专属集成支持。

未来功能更新

Mistral AI 正在扩展 Voxtral 的音频能力,包括:

  • 发言人分割
  • 词级时间戳
  • 非语音音频识别
  • 情绪与年龄的音频标记

研究文档

有关 Voxtral 研究与开发的详细技术信息,可在官方研究论文(arXiv:2507.13264)中查阅。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch