Spr-Aachen/Easy-Voice-Toolkit
A user-friendly toolkit for voice recgonition/transcription/conversion etc. | 简单易用的语音工具箱
Easy Voice Toolkit – 快速概覽
它是什麼 – 一個桌面加 Colab 的工具包,串聯了多個開源語音相關模型(例如 Whisper 用於轉錄、GPT-SoVITS 用於語音轉換)和工具,讓您可以取得原始音訊、清理、轉錄、建立資料集、訓練語音轉換模型,最後生成轉換後的語音。此專案提供即開即用的 Windows 可攜式套件,也提供 Jupyter 筆記本供雲端使用。
主要功能
- 音訊處理 – 修剪、切片和格式處理。
- 語音辨識與轉錄 – 由 OpenAI 的 Whisper 驅動。
- 資料集建立 – 準備語音轉換訓練用配對音訊的工具。
- 模型訓練 – 包裝 GPT-SoVITS 管線以訓練新語音模型的腳本。
- 語音轉換 – 將輸入說話者的語音轉換為已訓練目標語音的風格。
如何開始
- Windows 使用者 – 點擊 下載 Windows 可攜式套件 徽章;解壓縮並執行
run.py(無需安裝 Python)。 - Colab 使用者 – 透過徽章開啟 Google Colab Demo 筆記本,依照儲存格安裝依賴項並在雲端執行相同工作流程。
- 開發者 – 複製儲存庫(含子模組),安裝 Python ≥ 3.8,安裝與您的 CUDA 版本匹配的 PyTorch,然後執行
pip install -r requirements.txt和pip install QEasyWidgets。執行run.py啟動 GUI 用戶端和後端伺服器。
典型工作流程
- 匯入原始音訊 → 可選的清理/切片。
- 使用 Whisper 轉錄以取得文字轉錄稿。
- 建立配對資料集(來源音訊 + 目標語音樣本)。
- 在該資料集上訓練 GPT-SoVITS 語音轉換模型。
- 轉換新的語句,產生聽起來像目標語音的語音。
法律 / 使用說明
- 僅供學術和學習目的使用;不適用於生產環境。
- 發布結果(例如影片)時,您必須揭露來源音訊,並註明原始創作者和此儲存庫。
- 作者要求您在將此工具包用於任何商業或非研究計劃之前,先與他們聯繫。
路線圖
- 計劃整合聊天機器人(LLM)以提供互動式語音助理功能。
- 將用戶端 UI 重構為 C++/Qt 以獲得更好的效能。
- 持續進行後端工作,並即將推出 Linux 支援。
致謝的上游專案 – audio-slicer、VoiceprintRecognition-Pytorch、OpenAI Whisper、SRT-to-CSV-and-audio-split 和 GPT-SoVITS。
以上所有資訊直接取自儲存庫的 README;未推斷任何額外功能。
相關
- 專案
- 專案
- 專案
- 專案