diodiogod/TTS-Audio-Suite

A ComfyUI custom node integration for local multi-engine multi-language Text-to-Speech and Voice Conversion. Supports: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (classic and multilingual), F5-TTS, Higgs Audio 2, 3, and VibeVoice with unlimited text length, SRT timing, Character support, and many audio tools

What it solves

TTS Audio Suiteは、膨大な数のText-to-Speech (TTS)、Voice Conversion (VC)、およびAutomatic Speech Recognition (ASR)エンジンを単一のモジュール式インターフェースに統合する、包括的なComfyUI拡張機能です。異なるAIモデルの複雑な依存関係の要件を、ランタイムの分離を通じて管理することで、高品質な音声合成、ボイスクローニング、および字幕同期音声生成のための集中型ハブを提供し、オーディオAIツールの断片化を解決します。

How it works

このスイートは、19種類の異なるエンジン(F5-TTS、Higgs Audio、MOSS-TTS、およびRVCを含む)をComfyUIノードに統合しています。最新のエンジンを主要なTransformers 5環境で実行できる一方で、脆弱なレガシー・スタックを専用のランタイムに分離して依存関係の競合を防ぐ、モジュール式アーキテクチャを採用しています。字幕作業においては、SRTファイルを処理して同期音声を作成し、「smart_natural」タイミングロジックを使用して、重なりを防ぎ、自然な発話フローを確保します。

Who it’s for

ノードベースのワークフロー内で、プロフェッショナル級のボイスオーバー、正確な字幕タイミング、ボイスクローニング、または自動文字起こしとオーディオ編集を必要とするComfyUIユーザー、コンテンツクリエイター、およびアニメーター向けに設計されています。

Highlights

  • Massive Engine Support: 数百の言語にわたるTTS、Voice Conversion、およびASRをカバーする19のエンジンを統合。
  • SRT Integration: 精密なタイミングとセグメントレベルのキャッシュを備えた、SRTファイルからのTTS生成に特化したノード。
  • Runtime Isolation: 最新のモデル環境とレガシーなモデル環境を分離することで、依存関係のデッドロックを防ぎます。
  • Advanced Audio Tools: プロンプトベースの属性を指定するVisual Tag Builder、口の動きに基づいたタイミングを調整するSilent Speech Analyzer、および統合されたRVCモデルトレーニングを含みます。
  • Voice Design: Qwen3-TTSやOmniVoiceのような互換性のあるエンジンを使用して、再利用可能な音声を作成するためのツール。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト