Mistral AI Voxtral TTS 发布

Mistral AI 推出了 Voxtral TTS,这是一个拥有 4B 参数的文本转语音 (TTS) 模型,旨在实现高保真、多语言的语音生成。该模型经过工程设计,能够以低延迟提供逼真且富有情感表现力的语音,使其适用于可扩展的企业级语音代理和实时交互。

高自然度的多语言语音生成

Voxtral TTS 支持九种语言的顶尖性能:英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语。该模型专注于真实性,通过捕捉文化细微差别、自然节奏和情感灵活性,包括解释上下文(如讽刺或快乐)的能力,以避免机械化的表达。

语音仿真与适配

Voxtral TTS 可以使用短至 3 秒的参考样本来适配自定义语音。这种适配不仅捕捉说话者的声音,还捕捉特定的细微差别,例如:

  • 微妙的口音
  • 语调和抑扬顿挫
  • 参考音频中存在的语言不流利现象

值得注意的是,该模型展示了零样本跨语言语音适配能力。它可以在一种语言中生成语音,同时采用另一种语言提供的语音提示的口音(例如,使用法语语音提示生成英语语音,从而产生自然的带有法语口音的英语)。

性能基准与人工评估

由于词错误率 (word-error-rate) 等自动化指标无法完全捕捉语音的自然度,Mistral AI 采用了由母语使用者进行的对比性人工评估。

  • 自然度: 人工评估表明,Voxtral TTS 与 ElevenLabs Flash v2.5 相比实现了更优越的自然度,同时保持了相似的首音频时间 (TTFA)。
  • 质量: 该模型在支持情感引导以实现逼真交互方面,其表现与 ElevenLabs v3 持平。
  • 零样本自定义语音: 在涵盖九种支持语言的并排偏好测试中,Voxtral TTS 在零样本多语言自定义语音设置下,相对于 ElevenLabs v2.5 Flash 显示出更宽的质量差距。

技术架构

Voxtral TTS 是一个基于 Transformer 的、自回归的、流匹配 (flow-matching) 模型,构建在 Ministral 3B 骨干网络之上。该架构由三个主要组件组成:

  1. Transformer Decoder Backbone: 3.4B 参数。
  2. Flow-Matching Acoustic Transformer: 390M 参数。
  3. Neural Audio Codec: 300M 参数(对称式编码器-解码器)。

处理流程: 该模型接受一个语音提示(5 到 25 秒)和一个文本提示。Transformer 骨干网络为每个音频帧预测一个语义标记 (semantic token);随后,流匹配 Transformer 执行 16 次函数评估 (NFEs) 以生成声学潜变量 (acoustic latent)。一个内部开发的编解码器使用语义 VQ (8192 vocabulary) 和声学 FSQ (36 dim and 21 levels) 潜变量,以 12.5Hz 的帧率进行因果音频处理。

延迟与流式传输能力

为实时语音代理应用而设计,Voxtral TTS 针对低延迟流式传输进行了优化:

  • 模型延迟: 对于典型的 500 字符输入(10 秒音频),延迟为 70ms。
  • 实时因子 (RTF): 约 9.7x。
  • 生成长度: 该模型原生支持生成长达两分钟的音频,API 支持通过智能交错技术生成更长的内容。

企业集成与可用性

Voxtral TTS 被定位为企业级语音流水线的输出层,能够与 Voxtral Transcribe 集成以实现完整的语音转语音工作流,或与现有的语音转文本和 LLM 技术栈集成。

访问与定价:

  • API 访问: 价格为每 1k 字符 0.016 美元。
  • 测试: 可在 Mistral Studio 和 Le Chat 中使用。
  • 开源权重: 一个包含若干参考语音的版本已根据 CC BY NC 4.0 许可在 Hugging Face 上发布。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch