NVIDIA Magpie TTS 多语言版本发布

NVIDIA 发布了 Magpie TTS Multilingual,这是一个拥有 364M 参数的开源权重文本转语音 (TTS) 模型,支持 12 种语言。此次发布使开发者能够在自己的基础设施上部署高质量的多语言语音合成,从而最大限度地减少首音频时间 (TTFA) 并保持对数据驻留和模型定制的完全控制。

多语言支持与能力

Magpie TTS Multilingual 为跨 12 种语言的语音应用提供了一个统一的开源基础,消除了为每个地区使用单独模型的需求。该模型支持:

  • 支持的语言: English, Spanish, French, German, Italian, Vietnamese, Mandarin, Hindi, Japanese, Modern Standard Arabic, Korean, 和 Brazilian Portuguese。
  • 新增语言: Modern Standard Arabic, Korean, 和 Brazilian Portuguese 是本次发布的新增内容。
  • 语音多样性: 通过共享的多语言说话人表示,每种语言都包含男性和女性说话人声音。
  • 语码转换 (Code-Switching): 该模型增强了对 Hindi 和 Japanese 的语码转换支持,利用自定义发音词典和 IPA grapheme-to-phoneme 处理来改进技术术语和名称的发音。

低延迟性能与部署

为了确保自然的对话,Magpie 专注于减少首音频时间 (TTFA),即从生成开始到第一段音频到达用户之间的延迟。通过在本地部署 NVIDIA NIM (优化后的推理容器),开发者可以避免托管服务的往返延迟。

性能基准测试

在单流情况下,Magpie 在各种 NVIDIA GPU 上可实现 32–79ms 的首音频时间。在 64 流并发负载下,B200 GPU 保持了 239ms 的 TTFA,同时实现了 319.81× 的实时倍率。

GPU 1-stream TTFA 1-stream RTFX 64-stream TTFA 64-stream RTFX
B200 32 ms 12.1× 239 ms 319.81×
H100 47ms 14.7× 290.79×
DGX Spark 53 ms 9.8× 962 ms 275.88×
A100 79 ms 12.2× 395 ms 197×

架构优化以实现实时语音

Magpie 利用了两种关键的架构改进来减少推理时间而不牺牲音频质量,详见论文 Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation (ICASSP 2026):

  1. 帧堆叠 (Frame Stacking): 解码器在每个解码步骤中预测两个音频帧而不是一个,从而有效地将解码器迭代次数减半。 | Local Transformer: 该组件对同时生成的 codebook tokens 之间的依赖关系进行建模,以优化音频并恢复在帧堆叠过程中损失的质量。

合成质量改进

此次发布改进了现有语言的合成质量,具体表现为降低了字符错误率 (CER) 并提高了说话人相似度 (SSIM)。

Language CER (prev) CER (this release) SSIM (prev) SSIM (this release)
French 2.70% 1.54% 0.703 0.747
Spanish 1.14% 0.60% 0.793 0.793
German 0.66% 0.80% 0.742 0.742

新语言 (Arabic: 1.62% CER, Korean: 2.69% CER, 和 Brazilian Portuguese: 2.91% CER) 为未来的迭代建立了基准。

企业级控制与集成

由于 Magpie 是一个开源权重模型,企业可以在私有或隔离环境中部署它,使用 NVIDIA NeMo 进行品牌特定语音或领域词汇的微调,并独立扩展服务栈。

Magpie 已集成到 NVIDIA Nemotron Voice Agent 开发者示例中,该示例为构建完整的语音智能体提供了一个参考架构。该系统结合了:

  • Nemotron Speech: 用于流式语音识别 (ASR)。
  • Magpie TTS: 用于多语言语音合成。
  • Nemotron Language/Multimodal Models: 用于推理和工具调用。 | NVIDIA NIM: 用于 GPU 优化的推理。
  • NeMo: 用于定制化和微调。

该参考实现支持生产模式,例如实时可中断 (barge-in) 对话和具有视觉理解能力的多模态语音智能体。

Sources

相关

  • Dispatch
  • Dispatch
  • 项目
  • Dispatch
  • Dispatch