diodiogod/TTS-Audio-Suite
A ComfyUI custom node integration for local multi-engine multi-language Text-to-Speech and Voice Conversion. Supports: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (classic and multilingual), F5-TTS, Higgs Audio 2, 3, and VibeVoice with unlimited text length, SRT timing, Character support, and many audio tools
해결하는 문제
TTS Audio Suite는 텍스트 음성 변환(TTS), 음성 변환(VC), 자동 음성 인식(ASR) 엔진을 수십 가지 통합한 포괄적인 ComfyUI 확장 기능입니다. 다양한 음성 AI 도구의 분산 문제를 해결하며, 고품질 음성 합성, 음성 클론, 자막 동기화 음성 생성을 위한 중앙 집중형 허브를 제공합니다. 또한 런타임 격리 기술을 통해 다양한 AI 모델의 복잡한 종속성 요구 사항을 관리합니다.
작동 방식
이 도구 세트는 F5-TTS, Higgs Audio, MOSS-TTS, RVC 등을 포함한 19개의 엔진을 ComfyUI 노드에 통합합니다. 최신 엔진은 주요 Transformers 5 환경에서 실행되며, 취약한 구형 스택은 전용 런타임에서 격리되어 종속성 충돌을 방지하는 모듈형 아키텍처를 사용합니다. 자막 작업에서는 SRT 파일을 처리하여 정확한 타이밍으로 음성을 생성하며, 'smart_natural' 타이밍 로직을 사용해 겹침을 방지하고 자연스러운 발화 흐름을 보장합니다.
대상 사용자
프로페셔널한 내레이션, 정밀한 자막 타이밍, 음성 클론, 또는 노드 기반 워크플로우 내에서 자동 음성 인식 및 오디오 편집이 필요한 ComfyUI 사용자, 콘텐츠 제작자, 애니메이터에게 적합합니다.
주요 특징
- 대규모 엔진 지원: TTS, 음성 변환, ASR를 아우르는 19개의 엔진으로 수백 가지 언어를 지원합니다.
- SRT 통합: 정밀한 타이밍과 세그먼트 단위 캐시를 갖춘 SRT 파일에서 TTS를 생성하는 전용 노드.
- 런타임 격리: 현대적 및 구형 모델 환경을 분리하여 종속성 데드락을 방지합니다.
- 고급 오디오 도구: 프롬프트 기반 속성을 위한 Visual Tag Builder, 입모양 기반 타이밍 분석을 위한 Silent Speech Analyzer, 통합된 RVC 모델 학습 기능 포함.
- 음성 디자인: Qwen3-TTS 및 OmniVoice와 같은 호환 엔진을 사용해 재사용 가능한 음성을 생성할 수 있는 도구.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트