fishaudio/Bert-VITS2
vits2 backbone with multilingual-bert
What it solves
VITS2 백본과 다국어 BERT 임베딩을 결합하여 음성 합성 품질과 자연스러움을 향상시키는 텍스트 음성 변환(TTS) 시스템을 제공합니다.
How it works
이 프로젝트는 텍스트 입력을 처리하고 고품질 오디오 출력을 생성하기 위해 다국어 BERT 모델이 통합된 VITS2 아키텍처를 구현합니다. MassTTS의 핵심 아이디어를 차용하여 기존 VITS 기반 프레임워크를 바탕으로 구축되었습니다.
Who it's for
고품질의 다국어 텍스트 음성 변환 모델을 학습시키고 배포하는 데 관심이 있는 개발자와 AI 연구자들을 위한 것입니다.
Highlights
- 더 나란한 텍스트 표현을 위한 다국어 BERT 통합.
- 효율적인 음성 합성을 위한 VITS2 백본 기반.
webui_preprocess.py를 통한 전처리 가이드 포함.
관련
- 프로젝트
fishaudio/fish-speech자연어 태그를 통해 세밀한 감정 제어를 가능하게 하는 최첨단 다국어 텍스트-to-음성 시스템. 이중-AR 아키텍처를 사용해 현실적인 음성 클로닝을 제공합니다.
- 프로젝트
Zyphra/ZONOS2ZONOS2는 Mixture-of-Experts 백본을 사용하는 고해상도 다국어 음성 합성 모델로, 자연스러운 음성 클로닝과 표현력 있는 감정 제어를 제공합니다.
- 프로젝트
SWivid/F5-TTSF5-TTS는 확산 트랜스포머와 플로우 매칭을 사용하여 빠르고 자연스럽고 충실한 음성을 생성하는 고성능 텍스트-to-음성 시스템입니다. 훈련 및 추론 속도가 빠릅니다.
- 프로젝트
VOICEVOX/voicevox_engineVOICEVOX Engine은 VOICEVOX 일본어 TTS 코어를 감싸는 오픈소스 HTTP 서버입니다. REST 엔드포인트를 통해 텍스트(또는 세부 합성 쿼리)를 전송하고 WAV 오디오를 수신할 수 있으며, 스트리밍, 사용자 사전, 프리셋, 음성 모핑, 노래 합성, 선택적 GPU 가속을 지원합니다. Docker 이미지와 모크 모드로 배포가 쉬우며, API는 `/docs`에서 문서화되어 있습니다.