PierrunoYT/Kokoro-TTS-Local
A local implementation of the Kokoro Text-to-Speech model, featuring dynamic module loading, automatic dependency management, and a web interface.
解決する課題
Kokoro-TTS-Localは、Kokoro-82Mテキスト読み上げモデルの合理化されたローカル実装を提供します。Hugging Faceからのモデルと音声のダウンロードを自動化し、高品質な音声をオフラインで生成するための使いやすいインターフェースを提供することで、複雑な手動設定の必要性を排除します。
仕組み
このプロジェクトはKokoro-82Mモデル(82Mパラメータモデル)をラップし、以下のいくつかのインタラクション方法を提供します:
- インターフェース: テキスト入力と音声選択のための、対話型コマンドラインインターフェース(CLI)とGradioベースのWebインターフェースを提供します。
- アセット管理: モデルファイル (
kokoro-v1_0.pth) と設定ファイルのダウンロードを自動的に処理します。また、HF_HUB_OFFLINE環境変数による専用のオフラインモードもサポートしています。 - 処理: システムは、アメリカ英語、イギリス英語、日本語、中国語(マンダリン)など、9言語にわたる54の音声をサポートしています。音声はWAV、MP3、AAC形式で出力可能です。
- ハードウェアアクセラレーション: 高速な生成のためにCUDA対応GPUをサポートしていますが、CPUでも動作可能です。
対象ユーザー
プライバシー、オフラインアクセス、または他のローカルAIワークフローへの統合のために、デバイス上のクラウドAPIに依存せず、自身のハードウェアで高品質なテキスト読み上げ合成をローカルで実行したいユーザー。
ハイライト
- 多言語サポート: 9つの異なる言語にわたる54の音声。
- オフライン機能: 初回の資産ダウンロード後は、完全なオフラインモードをサポート。
- ユーザーフレンドリーなインターフェース: Web UIとCLIの両方を含む。
- 包括的な診断: Pythonのバージョン、CUDAの可用性、および依存関係を検証するための組み込みの
kokoro-tts-checkツール。 - 柔軟な出力: 複数のオーディオ形式(WAV, MP3, AAC)と調整可能な話速(0.5xから2.0x)をサポート。
- Dockerサポート: CPUベースのセットアップ用にDocker経由のクイックスタートを提供。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト