RVC-Project/Retrieval-based-Voice-Conversion-WebUI

Easily train a good VC model with voice data <= 10 mins!

해결하는 문제

이 프로젝트는 음성 톤 변환과 음성 변경을 간단하고 쉽게 사용할 수 있는 프레임워크를 제공합니다. 원래의 발화 패턴을 유지하면서 소스 음성을 타겟 음성으로 변환할 수 있어, 고품질 음성 변경기로 작동합니다.

작동 방식

시스템은 입력 소스 특징을 트레이닝 세트에서 가져온 특징(상위1개 검색)으로 교체하는 리트리브 기반 접근 방식을 사용하여 톤 누출을 방지합니다. RMVPE(InterSpeech2023) 피치 추출 알고리즘을 활용하여 침묵 사운드를 제거하고 빠르고 자원 소모가 적은 처리를 보장합니다. 또한, pymss/MSST를 통한 보컬 분리 도구와 모델 병합 기능을 포함하여 톤 조정이 가능합니다.

대상 사용자

최소한의 데이터(10분 미만의 낮은 노이즈 오디오)로 자체 음성 모델을 훈련하고 싶은 크리에이터 및 개발자들을 위한 것입니다. 오프라인 변환 또는 실시간 음성 변경이 가능합니다.

주요 특징

  • 저지연: 엔드투엔드 지연이 170ms이며, ASIO 장치를 사용하면 90ms까지 줄일 수 있습니다.
  • 효율적인 훈련: 저사양 GPU에서도 빠른 훈련이 가능합니다.
  • 고품질: 정확한 피치 추출을 위한 RMVPE와 상위1개 리트리브를 사용하여 음성 일관성을 보장합니다.
  • 접근성: 사용자 친화적인 WebUI를 포함하고 있으며, NVIDIA, AMD, Intel(DirectML/CPU 경유)을 포함한 다양한 하드웨어 구성에 대응합니다.
  • 통합 도구: 악기와 보컬을 분리하는 기능을 내장하고 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트