remsky/Kokoro-FastAPI

Dockerized OpenAI-compatible wrapper for Kokoro-82M text-to-speech w/multiplatform CPU, AMD, NVIDIA GPU PyTorch; multi-speaker, voice-mixing, auto-stitching, caption timestamps, SSML, readalong web UI

解决的问题

Kokoro-FastAPI 为 Kokoro-82M 文本转语音(TTS)模型提供了一个高性能、Docker 化的 API 封装。它简化了高质量语音合成的部署,使用户能够在几分钟内生成数小时的音频,同时提供 OpenAI 兼容接口,便于集成到现有应用程序中。

工作原理

该项目将 Kokoro-82M 模型封装在 FastAPI 服务器中,暴露处理文本转语音请求的端点。支持多种硬件后端,包括 CPU、NVIDIA GPU(CUDA)、AMD GPU(ROCm)和 Apple Silicon(MPS)。系统处理文本、语音混合,并将音频编码为多种格式(MP3、WAV、Opus、FLAC、AAC、PCM),然后进行流式传输或返回最终音频文件。

适用人群

  • 开发者:寻找自托管、OpenAI 兼容的 TTS API 的人。
  • 内容创作者:需要为长篇内容快速生成高质量语音的人。
  • AI 应用构建者:希望在其软件中集成多说话人对话或复杂语音控制功能的人。

主要亮点

  • OpenAI 兼容性:使用标准的 Speech 端点,实现无缝集成。
  • 多语言支持:支持英语(美式/英式)、西班牙语、法语、印地语、意大利语、日语、巴西葡萄牙语和普通话中文。
  • 高级语音控制:支持加权语音组合(混合多个语音)、语音别名和通过标签实现的内联说话人切换。
  • 细粒度文本控制:支持内联标记控制停顿、IPA 发音、语速,以及实验性 SSML 支持。
  • 高性能:支持流式传输以降低首个标记延迟,并支持广泛的硬件加速。
  • 详细输出:可生成单词级或分块级的时间戳字幕。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目