NVIDIA Magpie TTS Multilingual 출시
NVIDIA는 12개 언어를 지원하는 364M-parameter open-weights 텍스트 음성 변환(TTS) 모델인 Magpie TTS Multilingual를 출시했습니다. 이번 출시를 통해 개발자는 고품질의 다국어 음성 합성을 자체 인프라에 배포하여 Time to First Audio (TTFA)를 최소화하고 데이터 거주성 및 모델 커스터마이징에 대한 완전한 제어권을 유지할 수 있습니다.
Multilingual Support and Capabilities
Magpie TTS Multilingual는 12개 언어에 걸쳐 음성 애플리케이션을 위한 단일 오픈 파운데이션을 제공하여 지역별로 별도의 모델을 사용할 필요를 없애줍니다. 이 모델은 다음을 지원합니다:
- Supported Languages: English, Spanish, French, German, Italian, Vietnamese, Mandarin, Hindi, Japanese, Modern Standard Arabic, Korean, and Brazilian Portuguese.
- New Language Additions: Modern Standard Arabic, Korean, and Brazilian Portuguese are new to this release.
- Voice Variety: 각 언어는 공유된 다국어 화자 표현을 통해 남성과 여성 화자의 목소리를 모두 포함합니다.
- Code-Switching: 이 모델은 커스텀 발음 사전과 IPA grapheme-to-phoneme 프로세싱을 활용하여 기술 용어 및 이름의 발음을 개선함으로써 Hindi와 Japanese의 code-switching 지원을 확장했습니다.
Low-Latency Performance and Deployment
자연스러운 대화를 보장하기 위해 Magpie TTS는 생성 시작부터 첫 번째 오디오가 사용자에게 도달할 때까지의 지연 시간인 Time to First Audio (TTFA)를 줄이는 데 집중합니다. NVIDIA NIM(최적화된 추론 컨테이너)을 통해 온프레미스에 배포함으로써 개발자는 관리형 서비스의 왕복 지연 시간을 피할 수 있습니다.
Performance Benchmarks
단일 스트림에서 Magpie는 다양한 NVIDIA GPU에서 32–79ms의 첫 오디오 도달 시간을 제공합니다. 64개 스트림의 동시 부하 상황에서 B200 GPU는 319.81 × real time의 처리량을 달성하면서 239ms의 TTFA를 유지합니다.
| GPU | 1-stream TTFA | 1-stream RTFX | 64-stream TTFA | 64-stream RTFX |
|---|---|---|---|---|
| B200 | 32 ms | 12.1× | 239 ms | 319.81× |
| H100 | 47ms | 14.7× | 275 ms | 290.79× |
| DGX Spark | 53 ms | 9.8× | 962 ms | 275.88× |
| A100 | 79 ms | 12.2× | 395 ms | 197× |
Architectural Optimizations for Real-Time Speech
Magpie는 오디오 품질을 희생하지 않으면서 추론 시간을 단축하기 위해 Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation (ICASSP 2026) 논문에서 상세히 설명된 두 가지 핵심적인 아키텍처 개선 사항을 활용합니다:
- Frame Stacking: 디코더는 한 번에 하나의 프레임 대신 두 개의 오디오 프레임을 디코딩 단계마다 예측하여 디코더 반복 횟수를 효과적으로 절반으로 줄입니다.
- Local Transformer: 이 구성 요소는 동시에 생성되는 codebook token 간의 의존성을 모델링하여 오디오를 정교화하고 frame stacking 과정에서 손실된 품질을 복구합니다.
Synthesis Quality Improvements
이번 출시를 통해 기존 언어의 합성 품질이 개선되었으며, 특히 Character Error Rates (CER)가 감소하고 Speaker Similarity (SSIM)가 증가했습니다.
| Language | CER (prev) | CER (this release) | SSIM (prev) | SSIM (this release) |
|---|---|---|---|---|
| French | 2.70% | 1.54% | 0.703 | 0.747 |
| Spanish | 1.14% | 0.60% | 0.793 | 0.793 |
| German | 0.66% | 0.80% | 0.742 | 0.742 |
새로운 언어(Arabic: 1.62% CER, Korean: 2.69% CER, 그리고 Brazilian Portuguese: 2.91% CER)는 향후 반복을 위한 베이스라인을 구축합니다.
Enterprise Control and Integration
Magpie는 open-weights 모델이기 때문에 기업은 이를 프라이빗 또는 에어갭 환경에 배포할 수 있으며, NVIDIA NeMo를 사용하여 브랜드 전용 목소리나 도메인 어휘를 위해 파인튜닝할 수 있고, 서빙 스택을 독립적으로 확장할 수 있습니다.
Magpie는 완전한 음성 에이전트를 구축하기 위한 참조 아키텍처를 제공하는 NVIDIA Nemotron Voice Agent 개발자 예제에 통합되어 있습니다. 이 시스템은 다음을 결합합니다:
- Nemotron Speech: 스트리밍 음성 인식(ASR)을 위해 사용됩니다.
- Magpie TTS: 다국어 음성 합성(TTS)을 위해 사용됩니다.
- Nemotron Language/Multimodal Models: 추론 및 도구 호출을 위해 사용됩니다.
- NVIDIA NIM: GPU 최적화 추론을 위해 사용됩니다.
- NeMo: 커스터마이징 및 파인튜닝을 위해 사용됩니다.
이 참조 구현은 실시간 중단 가능한(barge-in) 대화 및 시각 이해 기능을 갖춘 멀티모달 음성 에이전트와 같은 프로덕션 패턴을 지원합니다.
Sources
관련
- Dispatch
- Dispatch
- 프로젝트
- Dispatch
- Dispatch