breezeblue-ai/breeze-tts
Official PyTorch inference for Breeze TTS 2
解決する課題
Breeze TTS 2は、リアルタイムで表現力豊かなテキスト読み上げ(TTS)インタラクションのために設計されています。自然言語の指示で正確に制御できる高品質で低遅延の音声生成のニーズに応え、ユーザーが大規模な技術設定や複数の参照サンプルを必要とせずに、音声を作成または変更できるようにします。
仕組み
このモデルは、バイリンガル(英語と中国語)のオープンウェイトシステムで、3つの主要な動作モードをサポートしています:
- 音声クローン:参照音声クリップとその書き起こしを使用して、話者の音色とスタイルを複製します。
- 音声デザイン:自然言語の説明(例:「温かく、思慮深い若い女性」)のみに基づいて、完全に新しい音声を生成します。
- 音声ディレクション:参照音声と特定の指示を組み合わせて、クローンされた音声のトーン、感情、ペースを導きます。
また、括弧または角括弧を使用してテキストに直接挿入できる「ボーカルイベント」(笑い声やため息など)もサポートしています。超低遅延を実現するために、CUDAグラフと専用のデコードステージを備えた「高速パス」を利用して、最初の音声までの時間(TTFA)を最小限に抑えます。
対象ユーザー
このプロジェクトは、リアルタイムのAI音声エージェント、インタラクティブアプリケーションを構築する開発者や研究者、および英語と中国語の両方で音声の伝達と感情を正確に制御する必要があるコンテンツクリエイターを対象としています。
ハイライト
- 指示追従:自然言語を使用した参照不要の音声デザインと参照ガイド付き音声ディレクションをサポート。
- 超低遅延:NVIDIA H100 GPUで40ms未満の最初の音声までの時間(TTFA)を達成。
- バイリンガルサポート:単一のモデルで英語と中国語の音声を自然に処理。
- 表現力の制御:
(laugh)や(sigh)などのインラインのボーカルイベントを挿入して、より人間らしい発話を実現。 - GPU効率:イーガー推論で約7.7 GiBのGPUメモリで動作。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト