prophesier/diff-svc

Singing Voice Conversion via diffusion model

What it solves

원래의 멜로디를 유지하면서 노래 목소리를 한 사람에서 다른 사람으로 변환(음색 변환)할 수 있으며, 기본적인 피치 교정을 지원합니다.

How it works

이 프로젝트는 확산 모델을 사용하여 입력된 노래 목소리를 목표 음색으로 변환합니다. Hubert 和 ContentVec과 같은 구성 요소를 사용하여 오디오를 처리하며, 다양한 오디오 형식과 샘플링 레이트(최대 44.1kHz)를 지원합니다.

Who it’s for

AI 기반 가창 목소리 변환 및 음색 전이(timbre transfer)에 관심 있는 음악가, 오디오 엔지니어 및 연구원입니다.

Who it’s for

AI 기반 가창 목소리 변환 및 음색 전이(timbre transfer)에 관심 있는 음악가, 오디오 엔기니어 및 연구원입니다.

Highlights

  • 44.1kHz의 고충실도 오디오를 지원합니다.
  • 기본적인 피치 교정 기능을 포함합니다.
  • 광범위한 입력 및 출력 오디오 형식을 지원합니다.
  • 추론 시 긴 오디오 파일을 위한 자동 슬라이싱 기능을 제공합니다.