pnnbao97/VieNeu-TTS

Vietnamese TTS with instant voice cloning • On-device • Real-time CPU inference • 24kHz audio quality • Chuyển văn bản thành giọng nói tiếng Việt • Text to speech tiếng Việt • TTS tiếng Việt

解决的问题

VieNeu-TTS 提供专为越南语优化的高保真、自然流畅的文本转语音(TTS)系统,支持英越双语混用(代码切换)。它解决了对本地化、低延迟语音合成的需求,能够在不依赖大规模计算资源的情况下,处理多说话人对话和即时语音克隆。

工作原理

该项目提供多种模型架构(v1、v2 和 v3 Turbo)。最新 v3 Turbo 版本采用从零开始设计的架构,支持 48 kHz 高保真音频输出和专用音素化器。支持不同后端:无需 torch 的 ONNX Runtime,适用于快速 CPU 推理和流式传输;以及适用于 GPU 高吞吐量批量生成的 PyTorch 引擎。此外,还包含一个降噪流水线,用于清理语音克隆用的参考音频片段。

适用人群

  • 开发者:正在构建交互式越南语 AI 应用或实时语音助手的开发者。
  • 内容创作者:需要为播客或对话场景生成自然越南语配音的内容创作者。
  • 边缘设备工程师:寻找轻量级、离线运行、在 CPU 或 Apple Silicon 上高效运行的 TTS 解决方案的工程师。

主要亮点

  • 双语支持:越南语与英语之间无缝切换。
  • 即时语音克隆:仅需 3–8 秒音频片段即可克隆语音。
  • 高保真度:v3 Turbo 支持 48 kHz 音频,实验性支持情感提示(如笑声、叹气)。
  • 灵活部署:提供 Python SDK、Web UI 或高性能 Docker 化 API 服务器。
  • 性能优化:支持帧级流式传输以实现实时交互,也支持批量生成以处理大规模合成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目