PierrunoYT/Kokoro-TTS-Local

A local implementation of the Kokoro Text-to-Speech model, featuring dynamic module loading, automatic dependency management, and a web interface.

解決的問題

Kokoro-TTS-Local 提供了一個精簡的 Kokoro-82M 文字轉語音模型的本地實作。它透過自動從 Hugging Face 下載模型與語音,並提供易於使用的介面來離線生成高品質語音,從而消除了複雜的手動設定需求。

工作原理

該專案封裝了 Kokoro-82M 模型(一個 82M 參數的模型),並提供了幾種互動方式:

  • 介面:提供用於文字輸入與語音選擇的互動式命令列介面 (CLI) 與基於 Gradio 的 Web 介面。
  • 資源管理:自動處理模型檔案 (kokoro-v1_0.pth) 與設定檔的下載。它還透過 HF_HUB_OFFLINE 環境變數支援專用離線模式。
  • 處理:系統支援 9 種語言的 54 種語音,包括美式英語、英式英語、日語、中文(普通話)等。它可以以 WAV、MP3 與 AAC 格式輸出音訊。
  • 硬體加速:支援相容 CUDA 的 GPU 以實現更快的生成,同時在 CPU 上也能正常運作。

適用對象

想要在自己的硬體上本地執行高品質文字轉語音合成的使用者,用於保護隱私、離線存取或整合到其他本地 AI 工作流中,而無需依賴裝置端的雲端 API。

亮點

  • 多語言支援:涵蓋 9 種不同語言的 54 種語音。
  • 離線能力:初始資源下載後支援完全離線模式。
  • 使用者友善介面:包括 Web UI 與 CLI。
  • 全面的診斷:內建 kokoro-tts-check 工具,用於驗證 Python 版本、CUDA 可用性及依賴項目。
  • 靈活的輸出:支援多種音訊格式 (WAV, MP3, AAC) 與可調節的語速 (0.5x 至 2.0x)。
  • Docker 支援:透過 Docker 實現基於 CPU 設定的快速啟動。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案