tronghieuit/v-tts

The lightest Vietnamese Text-to-Speech with Multi-Speaker TTS and Zero-Shot Voice Cloning.

解决的问题

V-TTS 为越南语文本转语音 (TTS) 提供了一种轻量且高效的解决方案,专门解决无需 GPU 即可在标准消费级硬件上运行的高质量语音合成和语音克隆需求。

工作原理

该系统使用由合成器、用于身份提取的说话人编码器、用于韵律和情感的风格编码器以及用于音高和能量的韵律预测器组成的神经架构。对于零样本克隆,它从 3-10 秒的参考音频剪辑中提取嵌入,以生成该特定声音的语音。它包含一个专门的越南语音素转换器,以支持北部和南部方言。

适用对象

  • 需要无需专业录音设备即可进行越南语配音的内容创作者
  • 希望通过简单的 Python API 或 ONNX 运行时将越南语 TTS 集成到应用程序中的开发人员
  • 希望通过独立的 .exe 应用程序获得即插即用体验的 Windows 用户

亮点

  • 超轻量级:仅 74.8M 参数,使其可以完全在 CPU 上运行。
  • 零样本克隆:只需 3-10 秒的参考音频即可克隆任何声音,无需微调。
  • 高性能:在 CPU 上实现比实时快 3-4 倍的推理速度。
  • 方言支持:内置对越南语北部和南部语音的支持。
  • 灵活部署:提供 Windows 应用、Docker 容器、Python 包以及用于 Web 和 Android 的 ONNX 导出。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目