prophesier/diff-svc
Singing Voice Conversion via diffusion model
What it solves
它能夠在保持原曲旋律的同時,將歌聲從一個人轉換為另一個人的音色(音色轉換),並支援基礎的音高修正。
How it works
該專案使用擴散模型將輸入的歌聲轉換為目標音色。它利用 Hubert 和 ContentVec 等組件進行音訊處理,並支援多種音訊格式與取樣率(最高可達 44.1kHz)。
Who it’s for
對 AI 驅動的歌聲轉換與音色轉換感興趣的音樂家、音訊工程師與研究人員。
Highlights
- 支援 44.1kHz 的高保真音訊。
- 包含基礎的音高修正功能。
- 支援廣泛的輸入與輸出音訊格式。
- 在推論過程中,針對長音訊檔案提供自動切片功能。