netease-youdao/Confucius4-TTS

Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine

What it solves

Confucius4-TTS 解决了高质量、多语言语音合成的挑战,能够在不同语言之间保持说话者的身份。它支持“零样本”语音克隆,意味着只需短短的音频样本即可复制声音,无需额外训练或参考音频的文字稿。

How it works

系统使用“语音编码器 + 大型语言模型 (LLM)”架构,分为两个主要阶段:

  1. Text2Semantic (T2S):基于 LLM 的阶段,从输入文本和说话者条件生成语义标记序列。
  2. Semantic2Acoustic (S2A):一个 flow‑matching 模型,将语义标记转换为 mel 谱图,再转化为波形。

为了提升性能,项目支持 vLLM 后端,利用 PagedAttention 加速 LLM 阶段。

Who it’s for

此工具面向从事语音合成、本地化和语音克隆的开发者与研究人员,支持 14 种语言(包括中文、英文、日文、韩文、德文、法文、西班牙文等)。

Highlights

  • Cross-Lingual Transfer:在目标语言合成无口音语音,同时保留原说话者的声音。
  • Zero-Shot Cloning:只需参考 WAV 文件即可即时克隆声音,无需文字稿。
  • Emotion Transfer:能够克隆参考音频的情感语调。
  • Broad Language Support:开箱即支持 14 种语言。
  • Flexible Deployment:提供 Gradio Web UI、Python API 与 FastAPI 服务器,支持流式和非流式音频生成。