Spr-Aachen/Easy-Voice-Toolkit
A user-friendly toolkit for voice recgonition/transcription/conversion etc. | 简单易用的语音工具箱
Easy Voice Toolkit – 快速概览
它是什么 – 一个桌面加 Colab 的工具包,串联了多个开源语音相关模型(例如 Whisper 用于转录、GPT-SoVITS 用于语音转换)和工具,让您可以获取原始音频、清理、转录、构建数据集、训练语音转换模型,最后生成转换后的语音。该项目提供即开即用的 Windows 便携式包,也提供 Jupyter 笔记本供云端使用。
主要功能
- 音频处理 – 修剪、切片和格式处理。
- 语音识别与转录 – 由 OpenAI 的 Whisper 驱动。
- 数据集构建 – 准备语音转换训练用配对音频的工具。
- 模型训练 – 包装 GPT-SoVITS 管道以训练新语音模型的脚本。
- 语音转换 – 将输入说话者的语音转换为已训练目标语音的风格。
如何开始
- Windows 用户 – 点击 下载 Windows 便携式包 徽章;解压并运行
run.py(无需安装 Python)。 - Colab 用户 – 通过徽章打开 Google Colab Demo 笔记本,按照单元格安装依赖项并在云端运行相同工作流程。
- 开发者 – 克隆仓库(含子模块),安装 Python ≥ 3.8,安装与您的 CUDA 版本匹配的 PyTorch,然后运行
pip install -r requirements.txt和pip install QEasyWidgets。运行run.py启动 GUI 客户端和后端服务器。
典型工作流程
- 导入原始音频 → 可选的清理/切片。
- 使用 Whisper 转录以获取文本转录稿。
- 构建配对数据集(源音频 + 目标语音样本)。
- 在该数据集上训练 GPT-SoVITS 语音转换模型。
- 转换新的语句,产生听起来像目标语音的语音。
法律 / 使用说明
- 仅供学术和学习目的使用;不适用于生产环境。
- 发布结果(例如视频)时,您必须披露源音频,并注明原始创作者和此仓库。
- 作者要求您在将此工具包用于任何商业或非研究计划之前,先与他们联系。
路线图
- 计划集成聊天机器人(LLM)以提供交互式语音助手功能。
- 将客户端 UI 重构为 C++/Qt 以获得更好的性能。
- 持续进行后端工作,并即将推出 Linux 支持。
致谢的上游项目 – audio-slicer、VoiceprintRecognition-Pytorch、OpenAI Whisper、SRT-to-CSV-and-audio-split 和 GPT-SoVITS。
以上所有信息直接取自仓库的 README;未推断任何额外功能。
相关
- 项目
- 项目
- 项目
- 项目