QwenAudio/CosyVoice
Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.
解決的問題
CosyVoice 解決了從文本生成自然、一致且可控語音的挑戰。它專門針對現實場景中處理各種方言、情感和複雜文本格式的高品質、零樣本多語言語音合成需求。
工作原理
該系統基於大型語言模型 (LLM),使用監督語義 token 來合成語音。它支援雙流(文本輸入與音訊輸出)以實現低至 150ms 的低延遲。該框架包括音素的發音修補 (inpainting)、特殊符號的文本歸一化,以及用於控制語言、方言、情感、語速和音量的指令支援等功能。
適用對象
專為從事語音合成的開發人員與研究人員、需要低延遲的生產級音訊應用,以及需要高度可控的多語言聲音克隆的用戶而設計。
亮點
- 多語言與方言支援:涵蓋 9 種常用語言與 18 種以上的中文方言。
- 零樣本聲音克隆:無需針對特定說話人進行預訓練,即可實現跨語言與多語言的聲音克隆。
- 高性能:實現了最先進的內容一致性、說話人相似度與韻律自然度。
- 低延遲:支援延遲低至 150ms 的串流推理。
- 可控性:支援發音修補以及各種情感與語速指令。