RVC-Project/Retrieval-based-Voice-Conversion-WebUI
Easily train a good VC model with voice data <= 10 mins!
解决的问题
该项目提供了一个简单易用的音色转换和变声框架。它能够在保持原始语音模式的同时,将源语音转换为目标语音,有效充当高质量的变声器。
工作原理
该系统采用基于检索的方法,用训练集中的特征(top1 检索)替换输入源特征,以防止音色泄漏。它利用 RMVPE(InterSpeech2023)音高提取算法消除静音部分,确保快速且低资源消耗的处理。该框架还包含用于人声分离(通过 pymss/MSST)和模型合并的工具,以调整音色。
适用人群
专为希望使用最少数据(仅需10分钟低噪声音频)训练自己的语音模型,并进行离线转换或实时变声的创作者和开发者设计。
主要亮点
- 低延迟:实现端到端延迟170ms,使用 ASIO 设备可降低至90ms。
- 高效训练:即使在低端GPU上也能实现快速训练。
- 高质量:使用 RMVPE 进行精确音高提取,并通过 top1 检索确保语音一致性。
- 易用性:包含用户友好的 WebUI,支持多种硬件配置,包括 NVIDIA、AMD 和 Intel(通过 DirectML/CPU)。
- 集成工具:内置支持从伴奏中分离人声。
相关
- 项目
- 项目
- 项目
- 项目
- 项目