netease-youdao/Confucius4-TTS

Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine

What it solves

Confucius4-TTS 解決了高品質、多語言語音合成的挑戰,能在不同語言間保留說話者的身份。它支援「零樣本」語音克隆,意味著只需短短的音訊樣本即可複製聲音,無需額外訓練或參考音訊的文字稿。

How it works

系統採用「語音編碼器 + 大型語言模型 (LLM)」架構,分為兩個主要階段:

  1. Text2Semantic (T2S):基於 LLM 的階段,從輸入文字與說話者條件生成語義標記序列。
  2. Semantic2Acoustic (S2A):一個 flow‑matching 模型,將語義標記轉換為 mel 頻譜圖,進而合成波形。

為提升效能,專案支援 vLLM 後端,利用 PagedAttention 加速 LLM 階段。

Who it’s for

此工具設計給從事語音合成、本地化與語音克隆的開發者與研究人員,支援 14 種語言(包括中文、英文、日文、韓文、德文、法文、西班牙文等)。

Highlights

  • Cross-Lingual Transfer:在目標語言合成無口音語音,同時保留原說話者的聲音。
  • Zero-Shot Cloning:只需參考 WAV 檔即可即時克隆聲音,無需文字稿。
  • Emotion Transfer:能夠克隆參考音訊的情感語調。
  • Broad Language Support:開箱即支援 14 種語言。
  • Flexible Deployment:提供 Gradio 網頁介面、Python API 與 FastAPI 伺服器,支援串流與非串流音訊生成。