Saganaki22/ComfyUI-OmniVoice-TTS
OmniVoice TTS nodes for ComfyUI - Zero-shot multilingual text-to-speech with voice cloning, voice design, and multi-speaker dialogue
解決する課題
このプロジェクトは、ゼロショット多言語テキスト読み上げ(TTS)システムであるOmniVoiceのComfyUIノードを提供します。これにより、ユーザーは600以上の言語で高品質な音声を生成でき、短いオーディオサンプルからの精密なボイスクローニングや、テキスト指示に基づく完全な合成音声の作成が可能になります。
仕組み
このシステムは、拡散ベースのオーディオ生成プロセスを使用しています。さまざまなTTSタスクのために、以下の特化したノードを統合しています:
- Voice Cloning: 3〜15秒の参照オーディオクリップを使用して、特定の声を模倣します。
- Voice Design: 性別、年齢、ピッチ、アクセントなどの属性をテキスト指示で指定して、新しい声を作成します。
- Longform TTS: スマートなチャンク分割により、長いテキストの安定性を維持しながら処理します。
- Multi-Speaker TTS:
[Speaker_N]:タグを使用して、異なる声にセリフを割り当て、会話を生成します。 - Whisper Integration: OpenAIのWhisper ASRを使用して、参照オーディオを自動的に文字起こしし、クローニングの精度を高めます。
パフォーマンスを最適化するために、互換性のあるGPU(SM80+)での高速推論のためのSageAttention CUDAカーネル、VRAMを節約するための自動CPUオフロード、および複数の精度モード(fp32, bf16, fp16)をサポートしています。
対象者
独自のモデルをトレーニングすることなく、プロフェッショナルグレードの多言語音声合成、ボイスクローニング、対話生成を必要とする、ComfyUIを使用するコンテンツクリエイター、開発者、およびAIアーティスト。
ハイライト
- 膨大な言語サポート: 600以上の言語をサポート。
- ゼロショットクローニング: わずか3〜15秒のオーディオから声をクローン。
- 表現力豊かな制御: 非言語タグ(例:
[laughter],[sigh])や特定の語彙/スタイル指示を含む。 - 高い効率性: リアルタイムよりも最大40倍速い推論速度(RTF 0.025)を提供。
- 柔軟なVRAM管理: 低スペックのハードウェアでも動作するように、自動CPUオフロードと量子化モデル(bf16)をサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト