netease-youdao/Confucius4-TTS
Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine
What it solves
Confucius4-TTS 解决了高质量、多语言语音合成的挑战,能够在不同语言之间保持说话者的身份。它支持“零样本”语音克隆,意味着只需短短的音频样本即可复制声音,无需额外训练或参考音频的文字稿。
How it works
系统使用“语音编码器 + 大型语言模型 (LLM)”架构,分为两个主要阶段:
- Text2Semantic (T2S):基于 LLM 的阶段,从输入文本和说话者条件生成语义标记序列。
- Semantic2Acoustic (S2A):一个 flow‑matching 模型,将语义标记转换为 mel 谱图,再转化为波形。
为了提升性能,项目支持 vLLM 后端,利用 PagedAttention 加速 LLM 阶段。
Who it’s for
此工具面向从事语音合成、本地化和语音克隆的开发者与研究人员,支持 14 种语言(包括中文、英文、日文、韩文、德文、法文、西班牙文等)。
Highlights
- Cross-Lingual Transfer:在目标语言合成无口音语音,同时保留原说话者的声音。
- Zero-Shot Cloning:只需参考 WAV 文件即可即时克隆声音,无需文字稿。
- Emotion Transfer:能够克隆参考音频的情感语调。
- Broad Language Support:开箱即支持 14 种语言。
- Flexible Deployment:提供 Gradio Web UI、Python API 与 FastAPI 服务器,支持流式和非流式音频生成。