netease-youdao/Confucius4-TTS
Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine
解決的問題
Confucius4-TTS 解決了多語言語音合成中,需在不同語言間維持同一說話人身份的挑戰。它特別解決了「零樣本」語音克隆問題,使系統能僅透過一段短的參考音訊片段,模仿該說話人的聲音,而無需該片段的文本轉錄或針對新說話人的額外訓練。
工作原理
該系統採用「語音編碼器 + 大型語言模型(LLM)」架構,分為兩個主要階段:
- Text2Semantic (T2S):一個自回歸 LLM,根據輸入文字和說話人條件生成語意標記序列。
- Semantic2Acoustic (S2A):一個流匹配模型,將這些語意標記轉換為梅爾頻譜圖,用於最終的音訊合成。
為優化效能,可使用 vLLM 後端與 PagedAttention 加速 T2S 生成階段。系統利用外部元件如 Wav2Vec2-BERT 進行語意特徵提取,以及 BigVGAN 作為神經聲碼器。
適用對象
該工具專為從事多語言應用的開發者和研究人員、需要跨語言保持一致語音克隆的內容創作者,以及建構需要自然、富有表現力且無口音的跨語言輸出的 AI 驅動語音合成系統的人士設計。
主要亮點
- 14種語言支援:支援中文、英文、日文、韓文、德文、法文、西班牙文、印尼文、義大利文、泰文、葡萄牙文、俄文、馬來文和越南文。
- 無需文字轉錄的克隆:僅需參考音訊檔案即可完成語音克隆,無需參考語音的文字轉錄。
- 跨語言遷移:使說話者能夠「說」其不熟悉的語言,同時保持其獨特的聲線特徵,避免不自然的口音。
- 情感遷移:不僅能克隆聲音的音色,還能複製參考音訊中的情感基調和情緒。
- 靈活部署:提供 Python API、Gradio Web 界面,以及支援串流與非串流音訊生成的 FastAPI 伺服器。
相關
- 專案
- 專案
- 專案
- 專案