nazdridoy/kokoro-tts

A CLI text-to-speech tool using the Kokoro model, supporting multiple languages, voices (with blending), and various input formats including EPUB books and PDF documents.

何を解決するか

Kokoro TTS は、テキストを高品質で自然な音声に変換するためのコマンドラインインターフェース(CLI)を提供します。EPUB形式の本、PDFドキュメント、テキストファイルなどの長文コンテンツを、音声ファイルやストリーミング音声に変換するプロセスを簡素化し、Kokoroモデルを使用するための複雑な設定を必要としません。

動作方法

このツールは、ONNXを介してKokoroモデルを使用して音声を合成します。標準入力(stdin)を介して他のプログラムからテキストをパイプするなど、さまざまな入力形式に対応しています。また、長文を扱いやすいセグメントに自動的に分割します。複数の言語をサポートし、異なるボイスにカスタマイズ可能な重みを割り当てることで、ハイブリッドボイスを作成できます。

対象ユーザー

GUI(グラフィカルユーザーインターフェース)を必要とせずに、ドキュメントや本をオーディオブックや音声ストリームに変換したい、ターミナルベースのワークフローを好むユーザー向けに設計されています。

特徴

  • ドキュメント対応:.epub、.pdf、.txt ファイルを直接処理でき、出力をチャプターごとに分割可能。
  • ボイスカスタマイズ:複数言語をサポートし、調整可能な重みで複数のボイスをブレンド可能。
  • 出力の柔軟性:ストリーミング再生、WAVおよびMP3形式、音声チャンクのマージが可能。
  • ハードウェアアクセラレーション:GPUサポートにより、合成速度が向上。
  • CLI統合:stdinを介して他のプログラムからのパイプをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト