yxlllc/DDSP-SVC
Real-time end-to-end singing voice conversion system based on DDSP (Differentiable Digital Signal Processing)
해결하는 문제
DDSP-SVC는 기존의 고품질 방법과 비교해 훨씬 더 효율적인 가창 음성 변환(AI 음성 변경)을 가능하게 합니다. SO-VITS-SVC와 같은 프로젝트에서 발생하는 높은 하드웨어 요구 사항과 긴 학습 시간 문제를 해결하여, 일반 개인용 컴퓨터에서도 고품질 음성 합성을 가능하게 합니다.
작동 방식
이 프로젝트는 미분 가능한 디지털 신호 처리(DDSP)를 사용하며, 고급 모델을 통해 출력 품질을 향상시킵니다. 현재 버전은 합성 품질을 개선하기 위해 rectified-flow 모델을 활용합니다. 프로세스는 다음과 같습니다:
- 전처리: ContentVec 또는 HubertSoft와 같은 인코더를 사용해 오디오에서 특징을 추출하고, RMVPE를 통해 피치를 추출합니다.
- 학습: 특정 음성 데이터셋(단일 또는 다중 발화자)에서 모델을 학습합니다.
- 합성: 비실시간 처리 또는 실시간 GUI를 사용해 입력 음성을 타겟 음성으로 변환합니다. 슬라이딩 윈도우, 크로스페이딩, SOLA 기반 스플라이싱을 활용해 낮은 지연 시간을 유지합니다.
대상 사용자
전문급 GPU 하드웨어가 없거나, 긴 학습 주기를 소요하는 AI 음성 변경기나 가창 음성 변환을 만들고 싶은 사용자에게 적합합니다.
주요 특징
- 저자원 사용: SO-VITS-SVC보다 훨씬 낮은 하드웨어 요구 사항을 갖춘 학습 및 합성.
- 빠른 학습: RVC 수준과 비슷한 속도로, 주문형 학습 시간이 수십 배 이상 단축됨.
- 고품질: rectified-flow 모델과 사전 학습된 보코더를 활용해 SO-VITS-SVC 및 RVC와 경쟁 가능한 합성 품질 제공.
- 유연한 합성: 고음질 비실시간 변환과 저지연 실시간 음성 변경 모두 지원.
- 다중 발화자 지원: 하나의 모델로 다양한 발화자 음색 간 전환 또는 혼합이 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트