PierrunoYT/Kokoro-TTS-Local
A local implementation of the Kokoro Text-to-Speech model, featuring dynamic module loading, automatic dependency management, and a web interface.
解決的問題
Kokoro-TTS-Local 提供了一個精簡的 Kokoro-82M 文字轉語音模型的本地實作。它透過自動從 Hugging Face 下載模型與語音,並提供易於使用的介面來離線生成高品質語音,從而消除了複雜的手動設定需求。
工作原理
該專案封裝了 Kokoro-82M 模型(一個 82M 參數的模型),並提供了幾種互動方式:
- 介面:提供用於文字輸入與語音選擇的互動式命令列介面 (CLI) 與基於 Gradio 的 Web 介面。
- 資源管理:自動處理模型檔案 (
kokoro-v1_0.pth) 與設定檔的下載。它還透過HF_HUB_OFFLINE環境變數支援專用離線模式。 - 處理:系統支援 9 種語言的 54 種語音,包括美式英語、英式英語、日語、中文(普通話)等。它可以以 WAV、MP3 與 AAC 格式輸出音訊。
- 硬體加速:支援相容 CUDA 的 GPU 以實現更快的生成,同時在 CPU 上也能正常運作。
適用對象
想要在自己的硬體上本地執行高品質文字轉語音合成的使用者,用於保護隱私、離線存取或整合到其他本地 AI 工作流中,而無需依賴裝置端的雲端 API。
亮點
- 多語言支援:涵蓋 9 種不同語言的 54 種語音。
- 離線能力:初始資源下載後支援完全離線模式。
- 使用者友善介面:包括 Web UI 與 CLI。
- 全面的診斷:內建
kokoro-tts-check工具,用於驗證 Python 版本、CUDA 可用性及依賴項目。 - 靈活的輸出:支援多種音訊格式 (WAV, MP3, AAC) 與可調節的語速 (0.5x 至 2.0x)。
- Docker 支援:透過 Docker 實現基於 CPU 設定的快速啟動。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案