chenpipi0807/ComfyUI-Index-TTS
使用IndexTTS模型在ComfyUI中实现高质量文本到语音转换的自定义节点。支持中文和英文文本,可以基于参考音频复刻声音特征。
해결하는 문제
이 프로젝트는 ComfyUI용 사용자 정의 노드 세트를 제공하여 고품질 텍스트-음성 변환(TTS)을 가능하게 합니다. 사용자는 짧은 참조 오디오 클립에서 음성 특성을 복제하고 언어, 속도, 감정에 대해 정밀한 제어를 가능하게 하여, 노드 기반 워크플로우 내에서 자연스럽고 다국어, 감정 표현이 풍부한 합성 음성을 생성하는 어려움을 해결합니다.
작동 방식
이 프로젝트는 IndexTTS 패밀리 모델(버전 1.5, 2, 2.5)을 ComfyUI 노드로 구현합니다. 참조 오디오 파일에서 스피커 임베딩을 추출하고, 입력 텍스트와 결합하여 음성을 합성합니다.
주요 기술적 메커니즘:
- 다중 모델 지원: IndexTTS-2.5, 2, 1.5 통합.
- 감정 제어: 감정을 조절하는 세 가지 방법: 참조 감정 오디오 클립 사용, 8차원 감정 벡터 조정(예: 기쁨, 분노, 슬픔), 또는 감정에 대한 텍스트 설명 제공(Qwen 감정 모델 기반).
- 발음 제어: 버전 2.5에서는 중국어의 경우 핀인, 영어의 경우 CMU 포네프, 일본어의 경우 카나를 텍스트 내에 직접 삽입하여 발음을 정정할 수 있습니다.
- 소설 구문 분석: 이야기 내 등장인물과 서사자를 자동으로 식별하여 각 역할에 다른 목소리를 할당하는 전용 "소설 텍스트 구조" 노드.
- 오디오 정리: 출력에서 리버브와 노이즈를 제거하는 통합 Audio Cleaner 노드.
대상 사용자
- 콘텐츠 제작자: 오디오북, 팟캐스트, 영상 제작 시 일관성 있고 고품질의 음성 클론이 필요한 사람.
- ComfyUI 사용자: AI 아티스트 및 개발자로서 생성 파이프라인에 프로페셔널 TTS를 통합하고자 하는 사람.
- 이야기 전달자: 소설이나 시나리오용 다중 캐릭터 대화를 생성하고자 하는 사용자.
주요 특징
- 다국어 간 클론: 중국어 참조 오디오를 사용해 영어, 일본어, 스페인어, 아랍어 등에서 음성 생성 가능(IndexTTS-2.5).
- 정밀한 속도 제어: 품질을 훼손하지 않고 음성 속도를 조절할 수 있는 네이티브
duration_factor. - 다중 역할 지원: 소설 텍스트를 분석하고 최대 5명의 개별 캐릭터 목소리와 서사자 목소리를 할당하는 전용 노드.
- 유연한 감정 조정: 벡터 기반 슬라이더와 자연어 기반 감정 설명 모두 지원.
- uma 메모리 관리: 모델을 메모리에 상주시킬지 여부를 전환하는 Cache Control 노드를 통해 VRAM 사용량을 관리.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트