Saganaki22/ComfyUI-OmniVoice-TTS

OmniVoice TTS nodes for ComfyUI - Zero-shot multilingual text-to-speech with voice cloning, voice design, and multi-speaker dialogue

解決する課題

このプロジェクトは、ゼロショット多言語テキスト読み上げ(TTS)システムであるOmniVoiceのComfyUIノードを提供します。これにより、ユーザーは600以上の言語で高品質な音声を生成でき、短いオーディオサンプルからの精密なボイスクローニングや、テキスト指示に基づく完全な合成音声の作成が可能になります。

仕組み

このシステムは、拡散ベースのオーディオ生成プロセスを使用しています。さまざまなTTSタスクのために、以下の特化したノードを統合しています:

  • Voice Cloning: 3〜15秒の参照オーディオクリップを使用して、特定の声を模倣します。
  • Voice Design: 性別、年齢、ピッチ、アクセントなどの属性をテキスト指示で指定して、新しい声を作成します。
  • Longform TTS: スマートなチャンク分割により、長いテキストの安定性を維持しながら処理します。
  • Multi-Speaker TTS: [Speaker_N]: タグを使用して、異なる声にセリフを割り当て、会話を生成します。
  • Whisper Integration: OpenAIのWhisper ASRを使用して、参照オーディオを自動的に文字起こしし、クローニングの精度を高めます。

パフォーマンスを最適化するために、互換性のあるGPU(SM80+)での高速推論のためのSageAttention CUDAカーネル、VRAMを節約するための自動CPUオフロード、および複数の精度モード(fp32, bf16, fp16)をサポートしています。

対象者

独自のモデルをトレーニングすることなく、プロフェッショナルグレードの多言語音声合成、ボイスクローニング、対話生成を必要とする、ComfyUIを使用するコンテンツクリエイター、開発者、およびAIアーティスト。

ハイライト

  • 膨大な言語サポート: 600以上の言語をサポート。
  • ゼロショットクローニング: わずか3〜15秒のオーディオから声をクローン。
  • 表現力豊かな制御: 非言語タグ(例:[laughter], [sigh])や特定の語彙/スタイル指示を含む。
  • 高い効率性: リアルタイムよりも最大40倍速い推論速度(RTF 0.025)を提供。
  • 柔軟なVRAM管理: 低スペックのハードウェアでも動作するように、自動CPUオフロードと量子化モデル(bf16)をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト