Saganaki22/ComfyUI-OmniVoice-TTS
OmniVoice TTS nodes for ComfyUI - Zero-shot multilingual text-to-speech with voice cloning, voice design, and multi-speaker dialogue
해결하는 문제
이 프로젝트는 제로샷 다국어 텍스트 음성 변환(TTS) 시스템인 OmniVoice를 위한 ComfyUI 노드를 제공합니다. 사용자는 600개 이상의 언어로 고품질 음성을 생성할 수 있으며, 짧은 오디오 샘플을 통한 정밀한 보이스 클로닝 또는 텍스트 설명을 기반으로 한 완전한 합성 음성 생성이 가능합니다.
작동 원리
이 시스템은 확산 기반(diffusion-based) 오디오 생성 프로세스를 사용합니다. 다양한 TTS 작업을 위해 다음과 같은 전문 노드를 통합합니다:
- Voice Cloning: 3~15초의 참조 오디오 클립을 사용하여 특정 목소리를 모방합니다.
- Voice Design: 성별, 연령, 피치, 악센트와 같은 속성을 텍스트 지침으로 지정하여 새로운 목소리를 생성합니다.
- Longform TTS: 스마트한 청킹(chunking)을 통해 긴 텍스트를 안정적으로 처리합니다.
- Multi-Speaker TTS:
[Speaker_N]:태그를 사용하여 서로 다른 목소리에 대사를 할당함으로써 대화를 생성합니다. - Whisper Integration: OpenAI의 Whisper ASR을 사용하여 참조 오디오를 자동으로 전사함으로써 클로닝 정확도를 높입니다.
성능 최적화를 위해 호환 가능한 GPU(SM80+)에서 더 빠른 추론을 위한 SageAttention CUDA 커널, VRAM 절약을 위한 자동 CPU 오프로딩, 그리고 다양한 정밀도 모드(fp32, bf16, fp16)를 지원합니다.
대상 사용자
자체 모델을 학습시킬 필요 없이 전문적인 수준의 다국어 음성 합성, 보이스 클로닝 및 대화 생성이 필요한 ComfyUI 사용자(콘텐츠 크리에이터, 개발자, AI 아티스트).
주요 특징
- 방대한 언어 지원: 600개 이상의 언어 지원.
- 제로샷 클로닝: 단 3~15초의 오디오만으로 목소리 클로닝.
- 표현력 있는 제어: 비언어적 태그(예:
[laughter],[sigh]) 및 특정 방언/스타일 지침 포함. - 높은 효율성: 실시간보다 최대 40배 빠른 추론 속도(RTF 0.025) 제공.
- 유연한 VRAM 사용: 저사양 하드웨어에서도 실행할 수 있도록 자동 CPU 오프로드 및 양자화 모델(bf16) 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트