RVC-Boss/GPT-SoVITS

1 min voice data can also be used to train a good TTS model! (few shot voice cloning)

해결하는 문제

GPT-SoVITS는 최소한의 데이터로 매우 사실적인 텍스트 음성 변환(TTS) 및 음성 변환 모델을 생성하도록 설계되었습니다. 특정 목소리를 클로닝하기 위해 방대한 데이터셋이 필요했던 문제를 해결하여, 사용자가 단 몇 초 또는 몇 분의 오디오만으로 대상 화자의 음색과 감정 표현을 유지하는 음성을 생성할 수 있게 합니다.

작동 원리

이 프로젝트는 GPT 스타일의 자기회귀 모델링과 SoVITS를 결합하여 음성을 합성합니다. 두 가지 주요 작동 모드를 제공합니다:

  • Zero-shot TTS: 5초 분량의 음성 샘플을 참조로 사용하여 학습 없이 음성을 생성합니다.
  • Few-shot TTS: 약 1분간의 학습 데이터를 사용하여 모델을 미세 조정함으로써 음성 유사성과 사실성을 크게 향상시킵니다.

전체 파이프라인을 처리하는 포괄적인 WebUI가 포함되어 있습니다: 배경 음악에서 보컬 분리(UVR5 사용), 오디오를 청크로 분할, 레이블링을 위한 자동 음성 인식(ASR), 그리고 최종적인 학습 및 추론 단계입니다.

대상 사용자

이 도구는 가상 비서, 게임 캐릭터 또는 접근성 도구와 같은 애플리케이션을 위해 목소리를 클로닝하고자 하는 콘텐츠 크리에이터, 개발자 및 AI 애호가를 위한 것이며, 특히 매우 제한된 소스 오디오로 고품질의 결과를 얻고자 하는 분들에게 적합합니다.

주요 특징

  • 다국어 지원: 학습 데이터가 다른 언어라 할지라도 영어, 일본어, 한국어, 광둥어 및 중국어로 추론을 수행할 수 있습니다.
  • 통합 툴셋: 음성 반주 분리, 자동 데이터셋 세그먼테이션, 다국어 ASR(Fun-ASR, SenseVoice)을 위한 내장 도구.
  • 다양한 모델 버전: 높은 오디오 충실도(v4의 48k 출력) 또는 더 나은 안정성 및 감정 표현(v3)과 같이 다양한 요구 사항에 최적화된 여러 버전(v1~v4 및 v2Pro)을 제공합니다.
  • 빠른 추론 속도: 빠른 생성을 위해 최적화되었으며, CPU 최적화 추론을 위한 특정 버전도 제공됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트