PierrunoYT/Kokoro-TTS-Local
A local implementation of the Kokoro Text-to-Speech model, featuring dynamic module loading, automatic dependency management, and a web interface.
解决的问题
Kokoro-TTS-Local 提供了一个精简的 Kokoro-82M 文本转语音模型的本地实现。它通过自动从 Hugging Face 下载模型和语音,并提供易于使用的界面来离线生成高质量语音,从而消除了复杂的手动设置需求。
工作原理
该项目封装了 Kokoro-82M 模型(一个 82M 参数的模型),并提供了几种交互方式:
- 界面:提供用于文本输入和语音选择的交互式命令行界面 (CLI) 和基于 Gradio 的 Web 界面。
- 资源管理:自动处理模型文件 (
kokoro-v1_0.pth) 和配置文件的下载。它还通过HF_HUB_OFFLINE环境变量支持专用离线模式。 - 处理:系统支持 9 种语言的 54 种语音,包括美式英语、英式英语、日语、中文(普通话)等。它可以以 WAV、MP3 和 AAC 格式输出音频。
- 硬件加速:支持兼容 CUDA 的 GPU 以实现更快的生成,同时在 CPU 上也能正常运行。
适用对象
想要在自己的硬件上本地运行高质量文本转语音合成的用户,用于保护隐私、离线访问或集成到其他本地 AI 工作流中,而无需依赖设备端云端 API。
亮点
- 多语言支持:涵盖 9 种不同语言的 54 种语音。
- 离线能力:初始资源下载后支持完全离线模式。
- 用户友好界面:包括 Web UI 和 CLI。
- 全面的诊断:内置
kokoro-tts-check工具,用于验证 Python 版本、CUDA 可用性和依赖项。 - 灵活的输出:支持多种音频格式 (WAV, MP3, AAC) 和可调节的语速 (0.5x 至 2.0x)。
- Docker 支持:通过 Docker 实现基于 CPU 设置的快速启动。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目