PierrunoYT/Kokoro-TTS-Local

A local implementation of the Kokoro Text-to-Speech model, featuring dynamic module loading, automatic dependency management, and a web interface.

解决的问题

Kokoro-TTS-Local 提供了一个精简的 Kokoro-82M 文本转语音模型的本地实现。它通过自动从 Hugging Face 下载模型和语音,并提供易于使用的界面来离线生成高质量语音,从而消除了复杂的手动设置需求。

工作原理

该项目封装了 Kokoro-82M 模型(一个 82M 参数的模型),并提供了几种交互方式:

  • 界面:提供用于文本输入和语音选择的交互式命令行界面 (CLI) 和基于 Gradio 的 Web 界面。
  • 资源管理:自动处理模型文件 (kokoro-v1_0.pth) 和配置文件的下载。它还通过 HF_HUB_OFFLINE 环境变量支持专用离线模式。
  • 处理:系统支持 9 种语言的 54 种语音,包括美式英语、英式英语、日语、中文(普通话)等。它可以以 WAV、MP3 和 AAC 格式输出音频。
  • 硬件加速:支持兼容 CUDA 的 GPU 以实现更快的生成,同时在 CPU 上也能正常运行。

适用对象

想要在自己的硬件上本地运行高质量文本转语音合成的用户,用于保护隐私、离线访问或集成到其他本地 AI 工作流中,而无需依赖设备端云端 API。

亮点

  • 多语言支持:涵盖 9 种不同语言的 54 种语音。
  • 离线能力:初始资源下载后支持完全离线模式。
  • 用户友好界面:包括 Web UI 和 CLI。
  • 全面的诊断:内置 kokoro-tts-check 工具,用于验证 Python 版本、CUDA 可用性和依赖项。
  • 灵活的输出:支持多种音频格式 (WAV, MP3, AAC) 和可调节的语速 (0.5x 至 2.0x)。
  • Docker 支持:通过 Docker 实现基于 CPU 设置的快速启动。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目