netease-youdao/Confucius4-TTS
Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine
What it solves
Confucius4-TTS 解決了高品質、多語言語音合成的挑戰,能在不同語言間保留說話者的身份。它支援「零樣本」語音克隆,意味著只需短短的音訊樣本即可複製聲音,無需額外訓練或參考音訊的文字稿。
How it works
系統採用「語音編碼器 + 大型語言模型 (LLM)」架構,分為兩個主要階段:
- Text2Semantic (T2S):基於 LLM 的階段,從輸入文字與說話者條件生成語義標記序列。
- Semantic2Acoustic (S2A):一個 flow‑matching 模型,將語義標記轉換為 mel 頻譜圖,進而合成波形。
為提升效能,專案支援 vLLM 後端,利用 PagedAttention 加速 LLM 階段。
Who it’s for
此工具設計給從事語音合成、本地化與語音克隆的開發者與研究人員,支援 14 種語言(包括中文、英文、日文、韓文、德文、法文、西班牙文等)。
Highlights
- Cross-Lingual Transfer:在目標語言合成無口音語音,同時保留原說話者的聲音。
- Zero-Shot Cloning:只需參考 WAV 檔即可即時克隆聲音,無需文字稿。
- Emotion Transfer:能夠克隆參考音訊的情感語調。
- Broad Language Support:開箱即支援 14 種語言。
- Flexible Deployment:提供 Gradio 網頁介面、Python API 與 FastAPI 伺服器,支援串流與非串流音訊生成。