QwenAudio/CosyVoice
Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.
解决的问题
CosyVoice 解决了从文本生成自然、一致且可控语音的挑战。它专门针对现实场景中处理各种方言、情感和复杂文本格式的高质量、零样本多语言语音合成需求。
工作原理
该系统基于大语言模型 (LLM),使用监督语义 token 来合成语音。它支持双流(文本输入和音频输出)以实现低至 150ms 的低延迟。该框架包括音素的发音修补 (inpainting)、特殊符号的文本归一化以及用于控制语言、方言、情感、语速和音量的指令支持等功能。
适用对象
专为从事语音合成的开发人员和研究人员、需要低延迟的生产级音频应用,以及需要高度可控的多语言声音克隆的用户而设计。
亮点
- 多语言与方言支持:涵盖 9 种常用语言和 18 种以上的中文方言。
- 零样本声音克隆:无需针对特定说话人进行预训练,即可实现跨语言和多语言的声音克隆。
- 高性能:实现了最先进的内容一致性、说话人相似度和韵律自然度。
- 低延迟:支持延迟低至 150ms 的流式推理。
- 可控性:支持发音修补以及各种情感和语速指令。