Mistral AI Voxtral 发布
Mistral AI 推出了 Voxtral,这是一系列前沿的语音理解模型,旨在弥合低精度开源自动语音识别(ASR)系统与昂贵专有 API 之间的差距。Voxtral 提供高精度转录和原生语义理解能力,包含两种尺寸——适用于生产规模应用的 24B 版本和适用于本地及边缘部署的 3B 版本,两者均采用 Apache 2.0 许可证发布。
核心功能与技术规格
Voxtral 模型将语音处理与 Mistral Small 3.1 和 Ministral 后端的文本理解能力相结合。这使得模型无需串联独立的自动语音识别(ASR)和语言模型即可执行复杂任务。
音频处理与上下文
- 上下文窗口: Voxtral 支持 32k 标记的上下文长度,可转录长达 30 分钟的音频文件,并理解长达 40 分钟的音频内容。
- 原生多语言支持: 模型具备自动语言检测功能,在广泛使用的语言中表现优异,包括英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语。
功能特性
- 集成问答与摘要生成: 用户可直接针对音频内容提问或原生生成结构化摘要。
- 直接函数调用: Voxtral 可根据用户语音意图触发后端函数、工作流或 API 调用,无需中间解析步骤。
- 文本处理能力: 由于保留了其语言模型后端的能力,Voxtral 模型可作为 Mistral Small 3.1 和 Ministral 的即插即用替代品。
性能基准测试
与开源和专有替代方案相比,Voxtral 在转录和音频理解任务中均表现出卓越性能。
语音转录
Voxtral 在所有评估任务中均优于 Whisper large-v3、GPT-4o mini Transcribe 和 Gemini 2.5 Flash。它在英语短文本转录和 Mozilla Common Voice 15.1 基准测试中达到最先进水平。在 FLEURS 基准测试中,Voxtral Small 在每个任务上均优于 Whisper,并在多种欧洲语言中达到最先进性能。
音频理解与翻译
Voxtral Small 在音频理解任务中与 GPT-4o-mini 和 Gemini 2.5 Flash 竞争力相当。它还在 FLEURS-Translation 基准测试的语音翻译任务中达到最先进水平。
部署与定价
Voxtral 通过多种渠道提供,以满足不同的部署需求:
- 本地部署: 24B 和 3B 模型均可通过 Hugging Face 下载。
- API 访问: 专为转录优化的版本 Voxtral Mini Transcribe 已通过 Mistral AI API 上线,起价为每分钟 0.001 美元。Mistral AI 声称该版本性能优于 OpenAI Whisper,且成本不到其一半。
- Le Chat: Voxtral 正在集成至 Le Chat 的语音模式,供网页和移动用户使用。
企业级与未来路线图
对于企业用户,Mistral AI 提供私有生产级部署、特定领域微调(例如法律或医疗场景)以及专属集成支持。
未来功能更新
Mistral AI 正在扩展 Voxtral 的音频能力,包括:
- 发言人分割
- 词级时间戳
- 非语音音频识别
- 情绪与年龄的音频标记
研究文档
有关 Voxtral 研究与开发的详细技术信息,可在官方研究论文(arXiv:2507.13264)中查阅。
Sources
- OriginalVoxtral
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch