voicepaw/so-vits-svc-fork

so-vits-svc fork with realtime support, improved interface and more features.

해결하는 문제

이 프로젝트는 가창 음성 변환을 위한 시스템을 제공하여, 사용자가 소스 오디오 파일 또는 라이브 마이크 입력을 특정 대상 화자의 목소리로 변경할 수 있도록 합니다. so-vits-svc를 기반으로 실시간 기능, 더 사용자 친화적인 인터페이스 및 더 빠른 학습 기능을 추가하여 개선되었습니다.

작동 방식

음성 변환을 위해 VITS 기반 아키텍처를 사용합니다. 파이프라인에는 오디오 전처리(리샘플링, 분할 및 화자 분리), HuBERT 또는 CREPE와 같은 모델을 사용한 피치 추정을 위한 특징 추출, 그리고 대상 화자의 데이터셋을 사용한 모델 학습이 포함됩니다. 학습이 완료되면 명령줄 인터페이스(CLI) 또는 그래픽 사용자 인터페이스(GUI)를 통해 추론에 사용할 수 있으며, 실시간 또는 파일로부터 오디오를 변환할 수 있습니다.

대상 사용자

노래 또는 말하기를 위한 보이스 클론을 만들고자 하는 사용자를 위해 설계되었습니다. 원클릭 설치 프로그램과 GUI를 사용할 수 있는 초보자부터 로컬 GPU 또는 Google Colab 및 Paperspace와 같은 클라우드 환경을 사용하여 직접 모델을 학습시킬 수 있는 고급 사용자까지 모두 포함됩니다.

주요 특징

  • 실시간 변환: 마이크를 통한 라이브 음성 변환을 지원합니다.
  • 개선된 인터페이스: 더 쉬운 조작을 위해 GUI와 통합 CLI를 모두 포함합니다.
  • 빠른 학습: 학습 속도가 기존 리포지토리보다 약 2배 빠릅니다.
  • 간편한 설치: pip를 통해 사용할 수 있으며 Windows용 원클릭 .bat 설치 프로그램을 포함합니다。
  • 정확도 향상: 더 정밀한 피치 추정을 위해 CREPE를 사용하고 이전의 ContentVec 오용 문제를 수정했습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트