KoljaB/RealtimeTTS

Converts text to speech in realtime

何を解決するか

RealtimeTTSは、テキストから音声への変換(TTS)システムで一般的に見られる高遅延を解消します。特に、文字列、ジェネレータ、またはリアルタイムのLLMトークンストリームを音声に変換する必要があるアプリケーションに最適です。ストリーミング音声再生とエンジン管理の複雑さを統一されたインターフェースで扱います。

動作方法

このライブラリは、広範なTTSエンジンのマトリクスをラップするもので、テキストをストリームに供給し、ローカル再生、別のプロセスへのストリーミング、またはWAVファイルとして保存できます。同期および非同期再生をサポートし、イテレータ経由でテキストがチャンク単位で到着する場合にも、音声の再生を可能な限り早く開始できます。また、発話の流れを最適化するための文分割ロジックも含まれています。

対象ユーザー

会話型AI、音声アシスタント、または動的なテキストソースからの低遅延かつ高品質な音声合成を必要とするアプリケーションを開発している開発者向けに設計されています。

主な特徴

  • 広範なエンジン対応: ローカルのニューラルモデル(QwenEngineやCoquiなど)、クラウドAPI(OpenAI、Azure、Elevenlabs)、システム音声に対応。
  • 低遅延: 推奨されるQwenEngineを用いることで、「最初のトークンまでの時間」(TTFT)を高速化し、聴覚的な開始遅延を最小限に抑えます。
  • 柔軟な出力: ローカルスピーカー再生、WAVファイルエクスポート、プロダクション環境向けのヘッドレスHTTPサーバーモードをサポート。
  • 高度な制御: ボイスクラウンニング、信頼性のためのフォールバックエンジン、単語タイミングや音声チャンクに対する詳細なコールバック機能を備えています。
  • LLM統合: LLMからのトークンストリームを処理するように特別に設計されており、テキスト生成と音声のギャップを最小限に抑えます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト