RVC-Boss/GPT-SoVITS
1 min voice data can also be used to train a good TTS model! (few shot voice cloning)
解决的问题
GPT-SoVITS 旨在使用极少量的数据创建高度逼真的文本转语音 (TTS) 和语音转换模型。它解决了克隆特定声音需要海量数据集的问题,使用户仅需几秒钟或几分钟的音频即可生成保持目标说话人音色和情感表达的语音。
工作原理
该项目将 GPT 风格的自回归建模与 SoVITS 结合用于语音合成。它提供两种主要的运行模式:
- Zero-shot TTS: 使用 5 秒钟的语音样本作为参考,无需任何训练即可生成语音。
- Few-shot TTS: 使用约 1 分钟的训练数据对模型进行微调,从而显著提高语音相似度和真实感。
它包含一个处理整个流水线的综合 WebUI:从背景音乐中分离人声 (通过 UVR5)、将音频切分为片段、执行自动语音识别 (ASR) 进行标注,以及最后的训练和推理。
适用对象
该工具适用于想要为虚拟助手、游戏角色或无障碍工具等应用克隆声音的内容创作者、开发人员和 AI 爱好者,特别是那些需要使用极少量源音频获得高质量结果的用户。
亮点
- 跨语言支持:即使训练数据是其他语言,也可以使用英语、日语、韩语、粤语和中文进行推理。
- 集成工具集:内置了用于人声伴奏分离、自动数据集分割和多语言 ASR (Fun-ASR, SenseVoice) 的工具。
- 多种模型版本:提供针对不同需求优化的各种版本(v1 到 v4 以及 v2Pro),例如更高的音频保真度(v4 中的 48k 输出)或更好的稳定性和情感表达(v3)。
- 高推理速度:针对快速生成进行了优化,并提供适用于 CPU 优化推理的特定版本。
相关
- 项目
- 项目
- 项目
- 项目
- 项目