prophesier/diff-svc

Singing Voice Conversion via diffusion model

What it solves

它能夠在保持原曲旋律的同時,將歌聲從一個人轉換為另一個人的音色(音色轉換),並支援基礎的音高修正。

How it works

該專案使用擴散模型將輸入的歌聲轉換為目標音色。它利用 Hubert 和 ContentVec 等組件進行音訊處理,並支援多種音訊格式與取樣率(最高可達 44.1kHz)。

Who it’s for

對 AI 驅動的歌聲轉換與音色轉換感興趣的音樂家、音訊工程師與研究人員。

Highlights

  • 支援 44.1kHz 的高保真音訊。
  • 包含基礎的音高修正功能。
  • 支援廣泛的輸入與輸出音訊格式。
  • 在推論過程中,針對長音訊檔案提供自動切片功能。