FunAudioLLM/CosyVoice

Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.

What it solves

CosyVoice 是一個基於大型語言模型(LLM)的文字轉語音(TTS)系統,旨在提供高品質的零樣本多語言語音合成。它解決了在「野外」情境下,如何產生自然且在不同語言與方言間保持說話者相似度與內容一致性的挑戰。

How it works

系統利用 LLM 產生語音。最新版本(Fun-CosyVoice 3.0)著重於規模擴大與後訓練,以提升韻律自然度與說話者相似度。它支援零樣本語音克隆,意即只需短短的樣本即可模仿說話者的聲音,無需大量重新訓練。系統亦包含文字正規化流程,能處理數字與符號,無需傳統前端模組。

Who it’s for

此專案適合需要可擴展、高效能 TTS 系統的開發者與研究人員,尤其是需要多語言與跨語言合成,或是建置需要低延遲串流的生產級音訊應用。

Highlights

  • Multilingual & Dialect Support: Covers 9 common languages and over 18 Chinese dialects/accents.
  • Zero-Shot Voice Cloning: Supports multi-lingual and cross-lingual voice cloning.
  • Low Latency: Achieves audio-out streaming latency as low as 150ms.
  • Controllability: Supports pronunciation inpainting for Pinyin and English phonemes, and instructions for emotion, speed, and volume.
  • Deployment Options: Compatible with vLLM and Nvidia TensorRT-LLM for accelerated inference.