wildminder/ComfyUI-VoxCPM
ComfyUI node for highly expressive speech and realistic zero-shot voice cloning
해결하는 문제
ComfyUI-VoxCPM은 VoxCPM 시스템을 위한 시각적 인터페이스를 제공하여 사용자가 코드를 작성할 필요 없이 표현력이 풍부하고 고품질의 음성을 생성하고 고급 보이스 클로닝을 수행할 수 있도록 합니다. 모델 관리, 오디오 처리 및 LoRA를 통한 음성 미세 조정 프로세스를 단순화합니다.
작동 방식
이 프로젝트는 토크나이저가 필요 없는 VoxCPM 모델(MiniCPM-4 백본 기반)을 ComfyUI에 커스텀 노드 세트로 통합합니다. 두 가지 주요 모델 버전을 지원합니다:
- VoxCPM2: 음성 설계(텍스트 설명으로 음성 생성), 레퍼런스 클로닝(오디오를 사용하여 정체성 복제), 및 "ultimate cloning"(서로 다른 소스에서 정체성과 운율 결합)을 지원합니다.
- VoxCPM1.5: 제로샷 TTS에 집중하며 네이티브 LoRA 학습 및 추론을 지원합니다.
사용자는 TTS 생성, 보이스 클로닝 구성 및 고급 확산(diffusion) 파라미터(temperature 및 CFG 등)를 위한 노드를 연결하여 출력 오디오 품질과 표현력을 제어할 수 있습니다.
대상 사용자
ComfyUI를 사용하며 전문적인 수준의 합성 음성을 생성하거나, 특정 음성을 클로닝하거나, 자연어 설명을 통해 커스텀 음성을 설계하고자 하는 콘텐츠 크리에이터, 오디오 엔지니어 및 AI 연구자.
주요 특징
- 고급 클로닝 모드: 제로샷, 레퍼런스 기반 및 "ultimate cloning"(정체성 + 운율)을 제공합니다.
- 음성 설계: 자연어 프롬프트(예: "따뜻한 여성의 목소리")를 사용하여 새로운 음성을 생성합니다.
- 다국어 지원: VoxCPM2는 48kHz 출력과 함께 30개 이상의 언어를 지원합니다.
- LoRA 통합: 커스텀 LoRA 모델 학습 및 추론을 위한 내장 노드가 포함되어 있습니다.
- 자동화된 관리: ComfyUI 환경 내에서 모델 다운로드 및 메모리 관리를 엔드 투 엔드로 처리합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트