NVIDIA Magpie TTS 多語言版本發佈

NVIDIA 已發佈 Magpie TTS Multilingual,這是一個擁有 364M 參數的開源權重文本轉語音 (TTS) 模型,支援 12 種語言。此版本讓開發者能夠在自己的基礎設施上部署高品質的多語言語音合成,以最小化首個音訊傳輸延遲 (TTFA),並完全掌控數據駐留與模型自定義。

多語言支援與能力

Magpie TTS Multilingual 為 12 種語言的語音應用提供單一的開源基礎,無需為每個地區準備獨立的模型。該模型支援:

  • 支援語言: 英語、西班牙語、法語、德語、義大利語、越南語、中文、印地語、日語、現代標準阿拉伯語、韓語和巴西葡萄牙語。
  • 新增語言: 現代標準阿拉伯語、韓語和巴西葡萄牙語是本次發佈的新增內容。
  • 語音多樣性: 每種語言都透過共享的多語言說話者表示法,包含男性和女性說話者聲音。
  • 語碼轉換 (Code-Switching): 該模型擴展了對印地語和日語語碼轉換的支援,利用自定義發音字典和 IPA 字形到音素 (grapheme-to-phoneme) 處理,以改進技術術語和名稱的發音。

低延遲性能與部署

為了確保自然的對話,Magpie TTS 專注於降低首個音訊傳輸延遲 (TTFA),即從生成開始到第一個音訊傳達到用戶之間的時間間隔。透過在本地部署 NVIDIA NIM(優化後的推理容器),開發者可以避免託管服務的往返延遲。

性能基準測試

在單一串流下,Magpie 在各種 NVIDIA GPU 上可在 32–79ms 內交付首個音訊。在 64 個串流的並發負載下,B200 GPU 保持 239ms 的 TTFA,同時實現 319.81× 的吞吐量。

GPU 1-stream TTFA 1-stream RTFX 64-stream TTFA 64-stream RTFX
B200 32 ms 12.1× 239 ms 319.81×
H100 47ms 14.7× 275 ms 290.79×
DGX Spark 53 ms 9.8× 962 ms 275.88×
A100 79 ms 12.2× 395 ms 197×

實時語音的架構優化

Magpie 利用兩項關鍵架構改進,在不犧牲音質的情況下縮短推理時間,詳見論文 Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation (ICASSP 2026):

  1. 幀堆疊 (Frame Stacking): 解碼器在每個解碼步驟預測兩個音訊幀而非一個,有效地將解碼器迭代次數減半。
  2. 局部 Transformer (Local Transformer): 此組件對同時生成的 codebook tokens 之間的依賴關係進行建模,以精煉音質並恢復在幀堆疊過程中損失的品質。

合成品質提升

此版本改進了現有語言的合成品質,特別是降低了字元錯誤率 (CER) 並提高了說話者相似度 (SSIM)。

語言 CER (先前) CER (本次發佈) SSIM (先前) SSSSIM (本次發佈)
法語 2.70% 1.54% 0.703 0.747
西班牙語 1.14% 0.60% 0.793 0.793
德語 0.66% 0.80% 0.742 0.742

新語言(阿拉伯語:1.62% CER,韓語:2.69% CER,以及巴西葡萄牙語:2.91% CER)為未來的迭代建立了基準。

企業級控制與整合

由於 Magpie 是一個開源權重模型,企業可以在私有或隔離環境中部署它,使用 NVIDIA NeMo 進行微調以獲得品牌專屬語音或領域詞彙,並獨立擴展服務棧。

Magpie 已整合到 NVIDIA Nemotron Voice Agent 開發者範例中,該範例為構建完整的語音代理提供了參考架構。該系統結合了:

  • Nemotron Speech: 用於串流語音識別 (ASR)。
  • Magpie TTS: 用於多語言語音合成。
  • Nemotron Language/Multimodal Models: 用於推理和工具調用。
  • NVIDIA NIM: 用於 GPU 優化推理。
  • NeMo: 用於自定義和微調。

此參考實現支援生產模式,例如實時可中斷(插話)對話以及具備視覺理解能力的跨模態語音代理。

Sources

相關

  • Dispatch
  • Dispatch
  • 專案
  • Dispatch
  • Dispatch