KittenML/KittenTTS

State-of-the-art TTS model under 25MB 😻

解决的问题

Kitten TTS 提供了一个轻量级、开源的文本转语音 (TTS) 库,让高质量的语音合成能在 CPU 上高效运行,而无需 GPU。它满足了边缘部署和本地环境中对于快速、低资源占用音频生成的需求。

工作原理

该库构建于 ONNX runtime 之上,提供了多种模型变体(参数量从 15M 到 80M 不等),以平衡性能与大小。它包含内置的文本预处理流水线,能处理数字、货币和单位,并以 24 kHz 的采样率输出音频。用户可以从八种内置语音中进行选择,并通过简单的 API 调整语速。

适用人群

希望将语音合成集成到应用程序中的开发者,且这些应用程序必须在有限的硬件、边缘设备或无法使用 GPU 加速的系统上运行。

亮点

  • 超轻量级:模型在磁盘上的大小范围为 25 MB 至 80 MB。
  • CPU 优化:使用 ONNX 进行高效推理,无需 GPU。
  • 内置语音:包含 8 种不同的语音(例如 Bella、Jasper、Luna)。
  • 文本规范化:集成的流水线用于展开缩写、日期和货币。
  • 灵活部署:同时支持 CPU 和 CUDA 后端。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目