tronghieuit/v-tts
The lightest Vietnamese Text-to-Speech with Multi-Speaker TTS and Zero-Shot Voice Cloning.
해결하는 문제
V-TTS는 베트남어 텍스트 음성 변환(TTS)을 위한 경량화되고 효율적인 솔루션을 제공하며, 특히 GPU 없이 표준 소비자용 하드웨어에서 실행 가능한 고품질 음성 합성 및 음성 클로닝 요구 사항을 해결합니다.
작동 원리
이 시스템은 합성기(synthesizer), ID 추출을 위한 스피커 인코더(speaker encoder), 운율 및 감정을 위한 스타일 인코더(style encoder), 그리고 피치와 에너지를 위한 운율 예측기(prosody predictor)로 구성된 신경망 아키텍처를 사용합니다. 제로샷 클로닝의 경우, 3~10초 분량의 참조 오디오 클립에서 임베딩을 추출하여 해당 특정 목소리로 음성을 생성합니다. 또한 북부 및 남부 방언을 모두 지원하기 위해 전용 베트남어 포네마이저(phonemizer)를 포함하고 있습니다.
대상 사용자
- 전문 녹음 장비 없이 베트남어 내레이션이 필요한 콘텐츠 크리에이터.
- 간단한 Python API 또는 ONNX 런타임을 통해 애플리케이션에 베트남어 TTS를 통합하려는 개발자.
- 독립형
.exe애플리케이션을 통해 플러그 앤 플레이 경험을 원하는 Windows 사용자.
주요 특징
- 초경량: 파라미터 수가 74.8M에 불과하여 CPU에서만 완전히 실행할 수 있습니다.
- 제로샷 클로닝: 미세 조정(fine-tuning) 없이 3~10초의 참조 오디오만으로 어떤 목소리든 클로닝할 수 있습니다.
- 고성능: CPU에서 실시간보다 3~4배 빠른 추론 속도를 달성합니다.
- 방언 지원: 북부 및 남부 베트남어 음성에 대한 내장 지원.
- 유연한 배포: Windows 앱, Docker 컨테이너, Python 패키지 및 Web 및 Android용 ONNX 내보내기로 제공됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트