netease-youdao/Confucius4-TTS
Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine
What it solves
Confucius4‑TTS는 고품질 다국어 음성 합성에서 화자의 정체성을 다양한 언어에 걸쳐 유지하는 문제를 해결합니다. "제로샷" 보이스 클로닝을 지원하여 짧은 오디오 샘플만으로도 추가 학습이나 레퍼런스 오디오의 텍스트 없이도 목소리를 복제할 수 있습니다.
How it works
시스템은 "음성 인코더 + 대형 언어 모델(LLM)" 아키텍처를 사용하며 두 단계로 동작합니다:
- Text2Semantic (T2S): LLM 기반 단계로, 입력 텍스트와 화자 조건을 바탕으로 의미 토큰 시퀀스를 생성합니다.
- Semantic2Acoustic (S2A): 플로우 매칭 모델이 의미 토큰을 멜 스펙트로그램으로 변환하고, 이를 파형으로 변환합니다.
성능 향상을 위해 프로젝트는 vLLM 백엔드를 지원하며, PagedAttention을 이용해 LLM 단계를 가속화합니다.
Who it’s for
이 도구는 음성 합성, 현지화, 보이스 클로닝 작업을 하는 개발자와 연구자를 위해 설계되었으며, 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 스페인어 등 14개의 언어를 지원합니다.
Highlights
- Cross-Lingual Transfer: 대상 언어에서 억양 없는 음성을 합성하면서 원본 화자의 목소리를 유지합니다.
- Zero-Shot Cloning: 레퍼런스 WAV 파일만으로 텍스트 없이 즉시 목소리를 클론합니다.
- Emotion Transfer: 레퍼런스 오디오의 감정 톤을 클론할 수 있습니다.
- Broad Language Support: 기본적으로 14개 언어를 지원합니다.
- Flexible Deployment: Gradio 웹 UI, Python API, FastAPI 서버를 제공하며 스트리밍 및 비스트리밍 오디오 생성 모두 지원합니다.