RVC-Project/Retrieval-based-Voice-Conversion-WebUI
Easily train a good VC model with voice data <= 10 mins!
해결하는 문제
이 프로젝트는 음성 톤 변환과 음성 변경을 간단하고 쉽게 사용할 수 있는 프레임워크를 제공합니다. 원래의 발화 패턴을 유지하면서 소스 음성을 타겟 음성으로 변환할 수 있어, 고품질 음성 변경기로 작동합니다.
작동 방식
시스템은 입력 소스 특징을 트레이닝 세트에서 가져온 특징(상위1개 검색)으로 교체하는 리트리브 기반 접근 방식을 사용하여 톤 누출을 방지합니다. RMVPE(InterSpeech2023) 피치 추출 알고리즘을 활용하여 침묵 사운드를 제거하고 빠르고 자원 소모가 적은 처리를 보장합니다. 또한, pymss/MSST를 통한 보컬 분리 도구와 모델 병합 기능을 포함하여 톤 조정이 가능합니다.
대상 사용자
최소한의 데이터(10분 미만의 낮은 노이즈 오디오)로 자체 음성 모델을 훈련하고 싶은 크리에이터 및 개발자들을 위한 것입니다. 오프라인 변환 또는 실시간 음성 변경이 가능합니다.
주요 특징
- 저지연: 엔드투엔드 지연이 170ms이며, ASIO 장치를 사용하면 90ms까지 줄일 수 있습니다.
- 효율적인 훈련: 저사양 GPU에서도 빠른 훈련이 가능합니다.
- 고품질: 정확한 피치 추출을 위한 RMVPE와 상위1개 리트리브를 사용하여 음성 일관성을 보장합니다.
- 접근성: 사용자 친화적인 WebUI를 포함하고 있으며, NVIDIA, AMD, Intel(DirectML/CPU 경유)을 포함한 다양한 하드웨어 구성에 대응합니다.
- 통합 도구: 악기와 보컬을 분리하는 기능을 내장하고 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트