CosyVoice: 基于先进 LLM 的文本到语音系统,用于零样本多语言语音合成

CosyVoice: 基于先进 LLM 的文本到语音系统,用于零样本多语言语音合成

它解决了什么问题

CosyVoice 解决了从文本生成自然、一致且可控语音的挑战。它专门针对高质量、零样本多语言语音合成的需求,能够在实际场景中处理各种方言、情感和复杂的文本格式。

它是如何工作的

基于大型语言模型(LLM),该系统使用监督语义标记来合成语音。它支持双向流(文本输入和音频输出),以实现低至 150ms 的延迟。框架包括诸如语音素材修复(用于音素)、特殊符号的文本规范化以及用于控制语言、方言、情感、速度和音量的指令支持等功能。

它面向谁

它专为从事语音合成的开发者和研究人员、需要低延迟的生产级音频应用以及需要高度可控多语言语音克隆的用户而设计。

亮点

  • 多语言 & 方言支持:覆盖 9 种常见语言和超过 18 种中文方言。
  • 零样本语音克隆:无需对特定说话者进行预训练,即可实现跨语言和多语言语音克隆。
  • 高性能:实现内容一致性、说话人相似度和韵律自然度的最先进水平。
  • 低延迟:支持流式推理,延迟低至 150ms。
  • 可控性:支持语音素材修复以及用于情感和速度的各种指令。

SUMMARY: CosyVoice 是一个基于先进 LLM 的文本到语音系统,专为高质量、零样本多语言语音合成和语音克隆而设计。

TITLE: CosyVoice: 基于先进 LLM 的文本到语音系统,用于零样本多语言语音合成

Sources