Spr-Aachen/Easy-Voice-Toolkit

A user-friendly toolkit for voice recgonition/transcription/conversion etc. | 简单易用的语音工具箱

Easy Voice Toolkit – 快速概览

它是什么 – 一个桌面加 Colab 的工具包,串联了多个开源语音相关模型(例如 Whisper 用于转录、GPT-SoVITS 用于语音转换)和工具,让您可以获取原始音频、清理、转录、构建数据集、训练语音转换模型,最后生成转换后的语音。该项目提供即开即用的 Windows 便携式包,也提供 Jupyter 笔记本供云端使用。

主要功能

  • 音频处理 – 修剪、切片和格式处理。
  • 语音识别与转录 – 由 OpenAI 的 Whisper 驱动。
  • 数据集构建 – 准备语音转换训练用配对音频的工具。
  • 模型训练 – 包装 GPT-SoVITS 管道以训练新语音模型的脚本。
  • 语音转换 – 将输入说话者的语音转换为已训练目标语音的风格。

如何开始

  1. Windows 用户 – 点击 下载 Windows 便携式包 徽章;解压并运行 run.py(无需安装 Python)。
  2. Colab 用户 – 通过徽章打开 Google Colab Demo 笔记本,按照单元格安装依赖项并在云端运行相同工作流程。
  3. 开发者 – 克隆仓库(含子模块),安装 Python ≥ 3.8,安装与您的 CUDA 版本匹配的 PyTorch,然后运行 pip install -r requirements.txtpip install QEasyWidgets。运行 run.py 启动 GUI 客户端和后端服务器。

典型工作流程

  1. 导入原始音频 → 可选的清理/切片。
  2. 使用 Whisper 转录以获取文本转录稿。
  3. 构建配对数据集(源音频 + 目标语音样本)。
  4. 在该数据集上训练 GPT-SoVITS 语音转换模型。
  5. 转换新的语句,产生听起来像目标语音的语音。

法律 / 使用说明

  • 仅供学术和学习目的使用;不适用于生产环境。
  • 发布结果(例如视频)时,您必须披露源音频,并注明原始创作者和此仓库。
  • 作者要求您在将此工具包用于任何商业或非研究计划之前,先与他们联系。

路线图

  • 计划集成聊天机器人(LLM)以提供交互式语音助手功能。
  • 将客户端 UI 重构为 C++/Qt 以获得更好的性能。
  • 持续进行后端工作,并即将推出 Linux 支持。

致谢的上游项目 – audio-slicer、VoiceprintRecognition-Pytorch、OpenAI Whisper、SRT-to-CSV-and-audio-split 和 GPT-SoVITS。


以上所有信息直接取自仓库的 README;未推断任何额外功能。

相关

  • 项目
  • 项目
  • 项目
  • 项目