remsky/Kokoro-FastAPI

Dockerized OpenAI-compatible wrapper for Kokoro-82M text-to-speech w/multiplatform CPU, AMD, NVIDIA GPU PyTorch; multi-speaker, voice-mixing, auto-stitching, caption timestamps, SSML, readalong web UI

解決的問題

Kokoro-FastAPI 為 Kokoro-82M 文字轉語音(TTS)模型提供了一個高效率、Docker 化的 API 封裝。它簡化了高品質語音合成的部署,讓使用者能在數分鐘內生成數小時的音訊,同時提供 OpenAI 相容的介面,方便整合至現有的應用程式中。

工作原理

此專案將 Kokoro-82M 模型封裝於 FastAPI 伺服器中,公開處理文字轉語音請求的端點。支援多種硬體後端,包括 CPU、NVIDIA GPU(CUDA)、AMD GPU(ROCm)與 Apple Silicon(MPS)。系統處理文字、語音混合,並將音訊編碼為多種格式(MP3、WAV、Opus、FLAC、AAC、PCM),再進行串流或回傳最終音訊檔案。

適用對象

  • 開發者:尋找自架設、OpenAI 相容的 TTS API 的人。
  • 內容創作者:需要為長篇內容快速生成高品質語音的人。
  • AI 應用建構者:希望在其軟體中整合多語音對話或複雜語音控制功能的人。

主要特色

  • OpenAI 相容性:使用標準的 Speech 端點,實現無縫整合。
  • 多語言支援:支援英語(美式/英式)、西班牙語、法語、印地語、義大利語、日語、巴西葡萄牙語與普通話中文。
  • 進階語音控制:支援加權語音組合(混合多個語音)、語音別名,以及透過標籤實現的內嵌說話人切換。
  • 細緻的文本控制:支援內嵌標記控制停頓、IPA 發音、語速,以及實驗性 SSML 支援。
  • 高效率:支援串流以降低首個標記延遲,並支援廣泛的硬體加速。
  • 詳細輸出:可產生單字級或區塊級的時間戳字幕。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案