voicepaw/so-vits-svc-fork
so-vits-svc fork with realtime support, improved interface and more features.
해결하는 문제
이 프로젝트는 가창 음성 변환을 위한 시스템을 제공하여, 사용자가 소스 오디오 파일 또는 라이브 마이크 입력을 특정 대상 화자의 목소리로 변경할 수 있도록 합니다. so-vits-svc를 기반으로 실시간 기능, 더 사용자 친화적인 인터페이스 및 더 빠른 학습 기능을 추가하여 개선되었습니다.
작동 방식
음성 변환을 위해 VITS 기반 아키텍처를 사용합니다. 파이프라인에는 오디오 전처리(리샘플링, 분할 및 화자 분리), HuBERT 또는 CREPE와 같은 모델을 사용한 피치 추정을 위한 특징 추출, 그리고 대상 화자의 데이터셋을 사용한 모델 학습이 포함됩니다. 학습이 완료되면 명령줄 인터페이스(CLI) 또는 그래픽 사용자 인터페이스(GUI)를 통해 추론에 사용할 수 있으며, 실시간 또는 파일로부터 오디오를 변환할 수 있습니다.
대상 사용자
노래 또는 말하기를 위한 보이스 클론을 만들고자 하는 사용자를 위해 설계되었습니다. 원클릭 설치 프로그램과 GUI를 사용할 수 있는 초보자부터 로컬 GPU 또는 Google Colab 및 Paperspace와 같은 클라우드 환경을 사용하여 직접 모델을 학습시킬 수 있는 고급 사용자까지 모두 포함됩니다.
주요 특징
- 실시간 변환: 마이크를 통한 라이브 음성 변환을 지원합니다.
- 개선된 인터페이스: 더 쉬운 조작을 위해 GUI와 통합 CLI를 모두 포함합니다.
- 빠른 학습: 학습 속도가 기존 리포지토리보다 약 2배 빠릅니다.
- 간편한 설치:
pip를 통해 사용할 수 있으며 Windows용 원클릭.bat설치 프로그램을 포함합니다。 - 정확도 향상: 더 정밀한 피치 추정을 위해 CREPE를 사용하고 이전의 ContentVec 오용 문제를 수정했습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트