lucasjinreal/Kokoros

🔥🔥 Kokoro in Rust. https://huggingface.co/hexgrad/Kokoro-82M Insanely fast, realtime TTS with high quality you ever have.

解決する課題

Kokorosは、高品質なオーディオ出力とともに極めて高速なテキスト読み上げ(TTS)合成を提供するために設計された、Kokoro TTSモデルの高パフォーマンスなRust実装です。スタンドアロンのバイナリとRustクレートを提供することで、重いPython依存関係を排除し、他のアプリケーションへの容易な統合を可能にします。

仕組み

このプロジェクトは、ONNX Runtimeを介してKokoro 82Mパラメータモデルを使用して推論を行います。エンドツーエンドのテキスト処理を行うために、組み込みのフォネマイザーとトークナイザー(Espeak-ngをサポート)が含まれています。このシステムは、コマンドラインツール (koko)、Rustライブラリ、またはスループットを最適化するためにストリーミングオーディオ生成と並列処理をサポートするOpenAI互換のHTTP APIサーバーとして使用できます。

対象ユーザー

  • Rustアプリケーションに高品質なTTSを組み込みたい開発者
  • 音声合成のための高速で軽量なCLIツールを求めるユーザー
  • 低遅延のストリーミングオーディオ応答を必要とするAIエージェントやデジタルヒューマンを構築しているエンジニア

ハイライト

  • 驚異的な推論速度: Rustで速度を最適化しており、CUDAおよびWASMをサポートしています。
  • OpenAI互換: 容易な統合のために、OpenAIのTTSエンドポイントを模倣したAPIサーバーを提供します。
  • ストリーミングサポート: 即時のオーディオ再生(低いTime-to-first-audio)を実現するため、CLIとHTTP APIの両方でストリーミングをサポートしています。
  • スタイルミキシング: カスタム音声エフェクトのために、異なる音声スタイル(例:af_sky.4 + af_nicole.5)のブレンドを許可します。
  • 単語レベルのタイムスタンプ: 各単語の正確な開始・終了時間を提供する .tsv サイドカーファイルを生成できます。
  • エンドツーエンド: 内部フォネマイゼーションを含んでおり、外部依存関係の必要性を排除しています。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト