Spr-Aachen/Easy-Voice-Toolkit

A user-friendly toolkit for voice recgonition/transcription/conversion etc. | 简单易用的语音工具箱

Easy Voice Toolkit – 快速概覽

它是什麼 – 一個桌面加 Colab 的工具包,串聯了多個開源語音相關模型(例如 Whisper 用於轉錄、GPT-SoVITS 用於語音轉換)和工具,讓您可以取得原始音訊、清理、轉錄、建立資料集、訓練語音轉換模型,最後生成轉換後的語音。此專案提供即開即用的 Windows 可攜式套件,也提供 Jupyter 筆記本供雲端使用。

主要功能

  • 音訊處理 – 修剪、切片和格式處理。
  • 語音辨識與轉錄 – 由 OpenAI 的 Whisper 驅動。
  • 資料集建立 – 準備語音轉換訓練用配對音訊的工具。
  • 模型訓練 – 包裝 GPT-SoVITS 管線以訓練新語音模型的腳本。
  • 語音轉換 – 將輸入說話者的語音轉換為已訓練目標語音的風格。

如何開始

  1. Windows 使用者 – 點擊 下載 Windows 可攜式套件 徽章;解壓縮並執行 run.py(無需安裝 Python)。
  2. Colab 使用者 – 透過徽章開啟 Google Colab Demo 筆記本,依照儲存格安裝依賴項並在雲端執行相同工作流程。
  3. 開發者 – 複製儲存庫(含子模組),安裝 Python ≥ 3.8,安裝與您的 CUDA 版本匹配的 PyTorch,然後執行 pip install -r requirements.txtpip install QEasyWidgets。執行 run.py 啟動 GUI 用戶端和後端伺服器。

典型工作流程

  1. 匯入原始音訊 → 可選的清理/切片。
  2. 使用 Whisper 轉錄以取得文字轉錄稿。
  3. 建立配對資料集(來源音訊 + 目標語音樣本)。
  4. 在該資料集上訓練 GPT-SoVITS 語音轉換模型。
  5. 轉換新的語句,產生聽起來像目標語音的語音。

法律 / 使用說明

  • 僅供學術和學習目的使用;不適用於生產環境。
  • 發布結果(例如影片)時,您必須揭露來源音訊,並註明原始創作者和此儲存庫。
  • 作者要求您在將此工具包用於任何商業或非研究計劃之前,先與他們聯繫。

路線圖

  • 計劃整合聊天機器人(LLM)以提供互動式語音助理功能。
  • 將用戶端 UI 重構為 C++/Qt 以獲得更好的效能。
  • 持續進行後端工作,並即將推出 Linux 支援。

致謝的上游專案 – audio-slicer、VoiceprintRecognition-Pytorch、OpenAI Whisper、SRT-to-CSV-and-audio-split 和 GPT-SoVITS。


以上所有資訊直接取自儲存庫的 README;未推斷任何額外功能。

相關

  • 專案
  • 專案
  • 專案
  • 專案