prophesier/diff-svc
Singing Voice Conversion via diffusion model
What it solves
它能够在保持原曲旋律的同时,将歌声从一个人转换为另一个人的音色(音色转换),并支持基础的音高修正。
How it works
该项目使用扩散模型将输入歌声转换为目标音色。它利用 Hubert 和 ContentVec 等组件进行音频音频处理,并支持多种音频格式与采样率(最高可达 44.1kHz)。
Who it’s for
对 AI 驱动的歌声转换与音色转换感兴趣的音乐家、音频工程师与研究人员。
Highlights
- 支持 44.1kHz 的高保真音频。
- 包含基础的音高修正能力。
- 支持广泛的输入与输出音频格式。
- 在推理过程中,针对长音频文件提供自动切片功能。