remsky/Kokoro-FastAPI
Dockerized OpenAI-compatible wrapper for Kokoro-82M text-to-speech w/multiplatform CPU, AMD, NVIDIA GPU PyTorch; multi-speaker, voice-mixing, auto-stitching, caption timestamps, SSML, readalong web UI
解決的問題
Kokoro-FastAPI 為 Kokoro-82M 文字轉語音(TTS)模型提供了一個高效率、Docker 化的 API 封裝。它簡化了高品質語音合成的部署,讓使用者能在數分鐘內生成數小時的音訊,同時提供 OpenAI 相容的介面,方便整合至現有的應用程式中。
工作原理
此專案將 Kokoro-82M 模型封裝於 FastAPI 伺服器中,公開處理文字轉語音請求的端點。支援多種硬體後端,包括 CPU、NVIDIA GPU(CUDA)、AMD GPU(ROCm)與 Apple Silicon(MPS)。系統處理文字、語音混合,並將音訊編碼為多種格式(MP3、WAV、Opus、FLAC、AAC、PCM),再進行串流或回傳最終音訊檔案。
適用對象
- 開發者:尋找自架設、OpenAI 相容的 TTS API 的人。
- 內容創作者:需要為長篇內容快速生成高品質語音的人。
- AI 應用建構者:希望在其軟體中整合多語音對話或複雜語音控制功能的人。
主要特色
- OpenAI 相容性:使用標準的 Speech 端點,實現無縫整合。
- 多語言支援:支援英語(美式/英式)、西班牙語、法語、印地語、義大利語、日語、巴西葡萄牙語與普通話中文。
- 進階語音控制:支援加權語音組合(混合多個語音)、語音別名,以及透過標籤實現的內嵌說話人切換。
- 細緻的文本控制:支援內嵌標記控制停頓、IPA 發音、語速,以及實驗性 SSML 支援。
- 高效率:支援串流以降低首個標記延遲,並支援廣泛的硬體加速。
- 詳細輸出:可產生單字級或區塊級的時間戳字幕。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案