PierrunoYT/Kokoro-TTS-Local

A local implementation of the Kokoro Text-to-Speech model, featuring dynamic module loading, automatic dependency management, and a web interface.

解決する課題

Kokoro-TTS-Localは、Kokoro-82Mテキスト読み上げモデルの合理化されたローカル実装を提供します。Hugging Faceからのモデルと音声のダウンロードを自動化し、高品質な音声をオフラインで生成するための使いやすいインターフェースを提供することで、複雑な手動設定の必要性を排除します。

仕組み

このプロジェクトはKokoro-82Mモデル(82Mパラメータモデル)をラップし、以下のいくつかのインタラクション方法を提供します:

  • インターフェース: テキスト入力と音声選択のための、対話型コマンドラインインターフェース(CLI)とGradioベースのWebインターフェースを提供します。
  • アセット管理: モデルファイル (kokoro-v1_0.pth) と設定ファイルのダウンロードを自動的に処理します。また、HF_HUB_OFFLINE 環境変数による専用のオフラインモードもサポートしています。
  • 処理: システムは、アメリカ英語、イギリス英語、日本語、中国語(マンダリン)など、9言語にわたる54の音声をサポートしています。音声はWAV、MP3、AAC形式で出力可能です。
  • ハードウェアアクセラレーション: 高速な生成のためにCUDA対応GPUをサポートしていますが、CPUでも動作可能です。

対象ユーザー

プライバシー、オフラインアクセス、または他のローカルAIワークフローへの統合のために、デバイス上のクラウドAPIに依存せず、自身のハードウェアで高品質なテキスト読み上げ合成をローカルで実行したいユーザー。

ハイライト

  • 多言語サポート: 9つの異なる言語にわたる54の音声。
  • オフライン機能: 初回の資産ダウンロード後は、完全なオフラインモードをサポート。
  • ユーザーフレンドリーなインターフェース: Web UIとCLIの両方を含む。
  • 包括的な診断: Pythonのバージョン、CUDAの可用性、および依存関係を検証するための組み込みの kokoro-tts-check ツール。
  • 柔軟な出力: 複数のオーディオ形式(WAV, MP3, AAC)と調整可能な話速(0.5xから2.0x)をサポート。
  • Dockerサポート: CPUベースのセットアップ用にDocker経由のクイックスタートを提供。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト