flybirdxx/ComfyUI-Qwen-TTS
A Simple Implementation of Qwen3-TTS's ComfyUI
해결하는 문제
이 프로젝트는 고품질 음성 합성(TTS), 제로샷 음성 클론, 그리고 노드 기반 워크플로우 내에서 음성 설계를 가능하게 하는 ComfyUI 커스텀 노드를 제공합니다. 텍스트에서 음성을 생성하거나, 짧은 오디오 샘플에서 음성을 클론하거나, 자연어 설명을 기반으로 완전히 새로운 음성을 생성할 수 있습니다.
작동 방식
알리바바의 오픈소스 Qwen3-TTS 모델을 통합하여 0.6B 및 1.7B 파라미터 모델을 모두 지원합니다. 추론 속도와 메모리 사용량을 최적화하기 위해 SAGE, Flash Attention 2, SDPA 등의 다양한 어텐션 메커니즘을 사용합니다. 다음 전용 노드를 제공합니다:
- 음성 설계: 텍스트 설명을 기반으로 음성 생성.
- 음성 클론: 참조 오디오를 기반으로 음성 클론.
- 사용자 정의 음성: 사전 설정된 스피커 사용.
- 대화 추론: 다중 역할 스크립트를 관리하고 복잡한 대화를 합성.
- 역할 백업 및 음성 클론 프롬프트: 음성 특징을 추출하고 저장하여 다양한 생성 간에 재사용 가능.
대상 사용자
이 도구는 오디오북, 역할극 시나리오, 캐릭터 중심 콘텐츠 제작 등 생성형 AI 워크플로우에 프로페셔널 수준의 음성 합성을 통합하고자 하는 ComfyUI 사용자를 위한 것입니다.
주요 특징
- 제로샷 클론: 5~15초의 짧은 참조 클립만으로 음성 클론 가능.
- 음성 설계: 자연어 프롬프트를 사용해 고유한 음성 특성 생성.
- 다국어 지원: 영어, 중국어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어를 네이티브 지원.
- 유연한 메모리 관리: 생성 후 모델을 GPU 메모리에서 언로드하는 옵션 제공. VRAM이 8GB 미만인 사용자도 지원.
- 최적화된 추론: 여러 어텐션 구현 방식을 지원해 상당한 속도 향상 제공.
- 다중 역할 대화: 여러 발화자 관리 및 지속적인 대화 스크립트 합성 전용 노드 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트