yxlllc/DDSP-SVC
Real-time end-to-end singing voice conversion system based on DDSP (Differentiable Digital Signal Processing)
解决的问题
DDSP-SVC 提供了一种比传统高质量方法高效得多的歌唱音色转换(AI语音变换)方式。它解决了 SO-VITS-SVC 等项目所面临的高硬件要求和长时间训练的问题,使在普通个人电脑上实现高质量语音合成成为可能。
工作原理
该项目使用可微分数字信号处理(DDSP),并通过先进模型提升输出质量。当前版本采用修正流模型(rectified-flow model)来提高合成质量。流程包括:
- 预处理:使用 ContentVec 或 HubertSoft 等编码器从音频中提取特征,并通过 RMVPE 进行音高提取。
- 训练:在特定语音数据集(单说话人或多人)上训练模型。
- 合成:使用非实时处理或实时 GUI 将输入语音转换为目标语音,通过滑动窗口、交叉淡入淡出和基于 SOLA 的拼接技术,保持低延迟。
适用人群
适合希望创建 AI 语音变换器或歌唱音色转换,但缺乏专业级 GPU 硬件或无法投入长时间训练周期的用户。
主要亮点
- 低资源消耗:相比 SO-VITS-SVC,训练和合成所需的硬件要求大幅降低。
- 快速训练:训练速度比传统方法快数个数量级,与 RVC 相当。
- 高质量合成:通过使用修正流模型和预训练声码器,实现与 SO-VITS-SVC 和 RVC 相媲美的合成质量。
- 灵活合成:支持高保真非实时转换和低延迟实时语音变换。
- 多说话人支持:可训练单个模型,实现不同说话人音色之间的切换或混合。
相关
- 项目
- 项目
- 项目
- 项目
- 项目