remsky/Kokoro-FastAPI
Dockerized OpenAI-compatible wrapper for Kokoro-82M text-to-speech w/multiplatform CPU, AMD, NVIDIA GPU PyTorch; multi-speaker, voice-mixing, auto-stitching, caption timestamps, SSML, readalong web UI
解决的问题
Kokoro-FastAPI 为 Kokoro-82M 文本转语音(TTS)模型提供了一个高性能、Docker 化的 API 封装。它简化了高质量语音合成的部署,使用户能够在几分钟内生成数小时的音频,同时提供 OpenAI 兼容接口,便于集成到现有应用程序中。
工作原理
该项目将 Kokoro-82M 模型封装在 FastAPI 服务器中,暴露处理文本转语音请求的端点。支持多种硬件后端,包括 CPU、NVIDIA GPU(CUDA)、AMD GPU(ROCm)和 Apple Silicon(MPS)。系统处理文本、语音混合,并将音频编码为多种格式(MP3、WAV、Opus、FLAC、AAC、PCM),然后进行流式传输或返回最终音频文件。
适用人群
- 开发者:寻找自托管、OpenAI 兼容的 TTS API 的人。
- 内容创作者:需要为长篇内容快速生成高质量语音的人。
- AI 应用构建者:希望在其软件中集成多说话人对话或复杂语音控制功能的人。
主要亮点
- OpenAI 兼容性:使用标准的 Speech 端点,实现无缝集成。
- 多语言支持:支持英语(美式/英式)、西班牙语、法语、印地语、意大利语、日语、巴西葡萄牙语和普通话中文。
- 高级语音控制:支持加权语音组合(混合多个语音)、语音别名和通过标签实现的内联说话人切换。
- 细粒度文本控制:支持内联标记控制停顿、IPA 发音、语速,以及实验性 SSML 支持。
- 高性能:支持流式传输以降低首个标记延迟,并支持广泛的硬件加速。
- 详细输出:可生成单词级或分块级的时间戳字幕。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目