voicepaw/so-vits-svc-fork

so-vits-svc fork with realtime support, improved interface and more features.

解决的问题

本项目提供了一个歌唱语音转换系统,允许用户将源音频文件或实时麦克风输入的语音转换为特定目标说话者的声音。它通过添加实时功能、更用户友好的界面和更快的训练速度,对原始的 so-vits-svc 进行了改进。

工作原理

它使用基于 VITS 的架构进行语音转换。流水线包括音频预处理(重采样、分割和说话人日志)、使用 HuBERT 或 CREPE 等模型进行音高估计的特征提取,以及在目标说话者的数据集上训练模型。训练完成后,可以通过命令行界面 (CLI) 或图形用户界面 (GUI) 进行推理,从而实现实时或从文件中转换音频。

适用对象

专为想要创建用于唱歌或说话的语音克隆的用户设计,范围涵盖从可以使用一键安装程序和 GUI 的初学者,到可以使用本地 GPU 或 Google Colab 和 Paperspace 等云环境训练自己模型的进阶用户。

亮点

  • 实时转换:支持来自麦克风的实时变声。
  • 改进的界面:包含 GUI 和统一的 CLI,以便于操作。
  • 更快的训练:训练速度比原始仓库快约两倍。
  • 简化的安装:可通过 pip 使用,并包含适用于 Windows 的一键式 .bat 安装程序。
  • 增强的准确性:使用 CREPE 进行更精确的音高估计,并修复了之前对 ContentVec 的误用。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目