CosyVoice: 一個基於大型語言模型的進階文字轉語音系統,用於零樣本多語言語音合成

CosyVoice: 一個基於大型語言模型的進階文字轉語音系統,用於零樣本多語言語音合成

它解決的問題

CosyVoice 解決了從文本生成自然、一致且可控語音的挑戰。它特別針對高品質、零樣本多語言語音合成的需求,能夠處理真實場景中的各種方言、情感和複雜文本格式。

它是如何運作的

該系統基於大型語言模型 (LLM),使用監督語義標記來合成語音。它支援雙向串流(文字輸入和音訊輸出),以實現低至 150ms 的延遲。框架包含語音修復(針對音素)、特殊符號的文本正規化,以及用於控制語言、方言、情感、速度和音量的指令支援。

適用對象

該系統專為從事語音合成的開發者和研究者、需要低延遲的生產級音訊應用,以及需要高度可控多語言語音克隆的使用者而設計。

特點

  • 多語言與方言支援:涵蓋 9 種常見語言及超過 18 種中國方言。
  • 零樣本語音克隆:無需針對特定說話者進行預訓練,即可實現跨語言和多語言語音克隆。
  • 高效能:達到最先進的內容一致性、說話者相似度和韻律自然度。
  • 低延遲:支援串流推理,延遲低至 150ms。
  • 可控性:支援語音修復以及用於情感和速度的各種指令。

Sources