lucasjinreal/Kokoros
🔥🔥 Kokoro in Rust. https://huggingface.co/hexgrad/Kokoro-82M Insanely fast, realtime TTS with high quality you ever have.
解決する課題
Kokorosは、高品質なオーディオ出力とともに極めて高速なテキスト読み上げ(TTS)合成を提供するために設計された、Kokoro TTSモデルの高パフォーマンスなRust実装です。スタンドアロンのバイナリとRustクレートを提供することで、重いPython依存関係を排除し、他のアプリケーションへの容易な統合を可能にします。
仕組み
このプロジェクトは、ONNX Runtimeを介してKokoro 82Mパラメータモデルを使用して推論を行います。エンドツーエンドのテキスト処理を行うために、組み込みのフォネマイザーとトークナイザー(Espeak-ngをサポート)が含まれています。このシステムは、コマンドラインツール (koko)、Rustライブラリ、またはスループットを最適化するためにストリーミングオーディオ生成と並列処理をサポートするOpenAI互換のHTTP APIサーバーとして使用できます。
対象ユーザー
- Rustアプリケーションに高品質なTTSを組み込みたい開発者
- 音声合成のための高速で軽量なCLIツールを求めるユーザー
- 低遅延のストリーミングオーディオ応答を必要とするAIエージェントやデジタルヒューマンを構築しているエンジニア
ハイライト
- 驚異的な推論速度: Rustで速度を最適化しており、CUDAおよびWASMをサポートしています。
- OpenAI互換: 容易な統合のために、OpenAIのTTSエンドポイントを模倣したAPIサーバーを提供します。
- ストリーミングサポート: 即時のオーディオ再生(低いTime-to-first-audio)を実現するため、CLIとHTTP APIの両方でストリーミングをサポートしています。
- スタイルミキシング: カスタム音声エフェクトのために、異なる音声スタイル(例:
af_sky.4 + af_nicole.5)のブレンドを許可します。 - 単語レベルのタイムスタンプ: 各単語の正確な開始・終了時間を提供する
.tsvサイドカーファイルを生成できます。 - エンドツーエンド: 内部フォネマイゼーションを含んでおり、外部依存関係の必要性を排除しています。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト