NVIDIA Magpie TTS Multilingual Release
NVIDIAは、12言語をサポートする364Mパラメータのオープンウェイト音声合成(TTS)モデルであるMagpie TTS Multilingualをリリースしました。このリリースにより、開発者は独自のインフラストラクチャに高品質な多言語音声合成をデプロイでき、Time to First Audio (TTFA) を最小限に抑え、データのレジデンシーとモデルのカスタマイズを完全に制御することが可能になります。
Multilingual Support and Capabilities
Magpie TTS Multilingualは、12言語にわたる音声アプリケーションのための単一のオープンな基盤を提供し、地域ごとに個別のモデルを用意する必要性を排除します。このモデルは以下をサポートしています:
- Supported Languages: English, Spanish, French, German, Italian, Vietnamese, Mandarin, Hindi, Japanese, Modern Standard Arabic, Korean, and Brazilian Portuguese.
- New Language Additions: Modern Standard Arabic, Korean, and Brazilian Portuguese are new to this release.
- Voice Variety: Each language includes both male and female speaker voices via a shared multilingual speaker representation.
- Code-Switching: The modelは、カスタムの発音辞書とIPA grapheme-to-phoneme処理を利用して、技術用語や名前の発音を改善し、HindiとJapaneseにおけるcode-switchingのサポートを拡張しています。
Low-Latency Performance and Deployment
自然な会話を実現するために、Magpie TTSは、生成開始から最初の音声がユーザーに届くまでの遅延であるTime to First Audio (TTFA) の削減に焦点を当てています。NVIDIA NIM(最適化された推論コンテナ)を介してオンプレミスにデプロイすることで、開発者はマネージドサービスのラウンドトリップ遅延を回避できます。
Performance Benchmarks
単一ストリームでは、Magpieは様々なNVIDIA GPU上で32–79msで最初の音声を届けます。64ストリームの同時負荷条件下では、B200 GPUは239msのTTFAを維持しながら、319.81× real timeの処理能力を達成しています。
| GPU | 1-stream TTFA | 1-stream RTFX | 64-stream TTFA | 64-stream RTFX |
|---|---|---|---|---|
| B200 | 32 ms | 12.1× | 239 ms | 319.81× |
| H100 | 47ms | 14.7× | 275 ms | 290.79× |
| DGX Spark | 53 ms | 9.8× | 962 ms | 275.88× |
| A100 | 79 ms | 12.2× | 395 ms | 197× |
Architectural Optimizations for Real-Time Speech
Magpieは、オーディオ品質を損なうことなく推論時間を短縮するために、論文 Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation (ICASSP 2026) に詳述されている2つの主要なアーキテクチャの改善を利用しています:
- Frame Stacking: デコーダーは、1回のデコーディングステップごとに1つのフレームではなく2つのオーディオフレームを予測するため、デコーダーのイテレーション回数を実質的に半分に減らすことができます。
- Local Transformer: このコンポーネントは、同時に生成されるcodebook tokens間の依存関係をモデル化し、オーディオを精緻化して、frame stackingによって失われた品質を回復します。
Synthesis Quality Improvements
今回のリリースでは、既存の言語における合成品質が向上しており、具体的にはCharacter Error Rates (CER) が減少し、Speaker Similarity (SSIM) が向上しています。
| Language | CER (prev) | CER (this release) | SSIM (prev) | SSIM (this release) | | :--- | :--- | :--- | :--- | :--- | :--- | | French | 2.70% | 1.54% | 0.703 | 0.747 | | Spanish | 1.14% | 0.60% | 0.793 | 0.793 | | German | 0.66% | 0.80% | 0.742 | 0.742 |
新しい言語(Arabic: 1.62% CER, Korean: 2.69% CER, および Brazilian Portuguese: 2.91% CER)は、将来のイテレーションのためのベースラインを確立しています。
Enterprise Control and Integration
Magpieはオープンウェイトモデルであるため、企業はプライベートまたはエアギャップ環境にデプロイし、NVIDIA NeMoを使用してブランド固有の音声やドメイン語彙を使用してファインチューニングを行い、サービングスタックを独立してスケールさせることができます。
Magpieは、完全な音声エージェントを構築するためのリファレンスアーキテクチャを提供するNVIDIA Nemotron Voice Agent開発者例に統合されています。このシステムは以下を組み合わせています:
- Nemotron Speech: For streaming speech recognition (ASR).
- Nemotron Language/Multimodal Models: For reasoning and tool calling.
- Magpie TTS: For multilingual speech synthesis.
- NVIDIA NIM: For GPU-optimized inference.
- NeMo: For customization and fine-tuning.
このリファレンス実装は、リアルタイムで割り込み可能な(barge-in)会話や、視覚理解を備えたマルチモーダル音声エージェントなどのプロダクションパターンをサポートしています。
Sources
関連
- Dispatch
- Dispatch
- プロジェクト
- Dispatch
- Dispatch