netease-youdao/Confucius4-TTS
Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine
해결하는 문제
Confucius4-TTS는 한 명의 화자가 다양한 언어에서 고품질의 다국어 음성 합성을 수행할 때 화자의 정체성을 유지해야 하는 문제를 해결합니다. 특히 "제로샷" 음성 클로닝 문제를 해결하여, 짧은 참조 클립에서 음성을 모방할 수 있도록 하며, 해당 클립의 텍스트 트랜스크립트나 새로운 화자에 대한 추가 학습이 필요하지 않습니다.
작동 방식
이 시스템은 "음성 인코더 + 대규모 언어 모델(LLM)" 아키텍처를 사용하며, 주로 두 가지 단계로 나뉩니다:
- Text2Semantic (T2S): 입력 텍스트와 화자 조건을 기반으로 의미 토큰 시퀀스를 생성하는 자기회귀형 LLM입니다.
- Semantic2Acoustic (S2A): 의미 토큰을 메르 스펙트로그램으로 변환하여 최종 음성 합성을 수행하는 플로우 매칭 모델입니다.
성능 최적화를 위해 vLLM 백엔드와 PagedAttention를 사용하여 T2S 생성 단계를 가속화할 수 있습니다. 외부 구성 요소로는 의미 특징 추출을 위한 Wav2Vec2-BERT와 신경 음성합성기인 BigVGAN을 활용합니다.
대상 사용자
이 도구는 다국어 애플리케이션 개발 및 연구에 종사하는 개발자와 연구자, 다양한 언어에서 일관된 음성 클로닝이 필요한 콘텐츠 제작자, 자연스럽고 표현력 있으며 악센트 없는 다국어 출력이 필요한 AI 기반 음성 합성 시스템을 구축하는 누구에게나 적합합니다.
주요 특징
- 14개 언어 지원: 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 스페인어, 인도네시아어, 이탈리아어, 태국어, 포르투갈어, 러시아어, 말레이어, 베트남어를 지원합니다.
- 트랜스크립트 없이 클로닝 가능: 참조 음성 파일만으로 음성 클로닝이 가능하며, 참조 음성의 텍스트 트랜스크립트가 필요하지 않습니다.
- 다국어 간 전이 가능: 화자가 모를 언어로도 자신의 고유한 음성 정체성을 유지하면서 말할 수 있으며, 부자연스러운 악센트를 피할 수 있습니다.
- 감정 전이 가능: 음성의 톤뿐만 아니라 참조 음성의 감정과 분위기도 클로닝할 수 있습니다.
- 유연한 배포 옵션: Python API, Gradio 웹 인터페이스, 스트리밍 및 비스트리밍 음성 생성을 지원하는 FastAPI 서버를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트