diodiogod/TTS-Audio-Suite
A ComfyUI custom node integration for local multi-engine multi-language Text-to-Speech and Voice Conversion. Supports: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (classic and multilingual), F5-TTS, Higgs Audio 2, 3, and VibeVoice with unlimited text length, SRT timing, Character support, and many audio tools
What it solves
TTS Audio Suiteは、膨大な数のText-to-Speech (TTS)、Voice Conversion (VC)、およびAutomatic Speech Recognition (ASR)エンジンを単一のモジュール式インターフェースに統合する、包括的なComfyUI拡張機能です。異なるAIモデルの複雑な依存関係の要件を、ランタイムの分離を通じて管理することで、高品質な音声合成、ボイスクローニング、および字幕同期音声生成のための集中型ハブを提供し、オーディオAIツールの断片化を解決します。
How it works
このスイートは、19種類の異なるエンジン(F5-TTS、Higgs Audio、MOSS-TTS、およびRVCを含む)をComfyUIノードに統合しています。最新のエンジンを主要なTransformers 5環境で実行できる一方で、脆弱なレガシー・スタックを専用のランタイムに分離して依存関係の競合を防ぐ、モジュール式アーキテクチャを採用しています。字幕作業においては、SRTファイルを処理して同期音声を作成し、「smart_natural」タイミングロジックを使用して、重なりを防ぎ、自然な発話フローを確保します。
Who it’s for
ノードベースのワークフロー内で、プロフェッショナル級のボイスオーバー、正確な字幕タイミング、ボイスクローニング、または自動文字起こしとオーディオ編集を必要とするComfyUIユーザー、コンテンツクリエイター、およびアニメーター向けに設計されています。
Highlights
- Massive Engine Support: 数百の言語にわたるTTS、Voice Conversion、およびASRをカバーする19のエンジンを統合。
- SRT Integration: 精密なタイミングとセグメントレベルのキャッシュを備えた、SRTファイルからのTTS生成に特化したノード。
- Runtime Isolation: 最新のモデル環境とレガシーなモデル環境を分離することで、依存関係のデッドロックを防ぎます。
- Advanced Audio Tools: プロンプトベースの属性を指定するVisual Tag Builder、口の動きに基づいたタイミングを調整するSilent Speech Analyzer、および統合されたRVCモデルトレーニングを含みます。
- Voice Design: Qwen3-TTSやOmniVoiceのような互換性のあるエンジンを使用して、再利用可能な音声を作成するためのツール。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト