QwenAudio/CosyVoice

Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.

解决的问题

CosyVoice 解决了从文本生成自然、一致且可控语音的挑战。它专门针对现实场景中处理各种方言、情感和复杂文本格式的高质量、零样本多语言语音合成需求。

工作原理

该系统基于大语言模型 (LLM),使用监督语义 token 来合成语音。它支持双流(文本输入和音频输出)以实现低至 150ms 的低延迟。该框架包括音素的发音修补 (inpainting)、特殊符号的文本归一化以及用于控制语言、方言、情感、语速和音量的指令支持等功能。

适用对象

专为从事语音合成的开发人员和研究人员、需要低延迟的生产级音频应用,以及需要高度可控的多语言声音克隆的用户而设计。

亮点

  • 多语言与方言支持:涵盖 9 种常用语言和 18 种以上的中文方言。
  • 零样本声音克隆:无需针对特定说话人进行预训练,即可实现跨语言和多语言的声音克隆。
  • 高性能:实现了最先进的内容一致性、说话人相似度和韵律自然度。
  • 低延迟:支持延迟低至 150ms 的流式推理。
  • 可控性:支持发音修补以及各种情感和语速指令。