RVC-Boss/GPT-SoVITS
1 min voice data can also be used to train a good TTS model! (few shot voice cloning)
解決的問題
GPT-SoVITS 旨在使用極少量的數據建立高度逼真的文本轉語音 (TTS) 與語音轉換模型。它解決了克隆特定聲音需要海量數據集的問題,使用戶僅需幾秒鐘或幾分鐘的音訊即可生成保持目標說話人音色與情感表達的語音。
工作原理
該專案將 GPT 風格的自回歸建模與 SoVITS 結合用於語音合成。它提供兩種主要的運行模式:
- Zero-shot TTS:使用 5 秒鐘的語音樣本作為參考,無需任何訓練即可生成語音。
- Few-shot TTS:使用約 1 分鐘的訓練數據對模型進行微調,從而顯著提高語音相似度與真實感。
它包含一個處理整個流程的綜合 WebUI:從背景音樂中分離人聲 (透過 UVR5)、將音訊切割成片段、執行自動語音識別 (ASR) 進行標註,以及最後的訓練與推理。
適用對象
該工具適用於想要為虛擬助手、遊戲角色或無障礙工具等應用克隆聲音的內容創作者、開發人員與 AI 愛好者,特別是那些需要使用極少量來源音訊獲得高品質結果的使用者。
亮點
- 跨語言支持:即使訓練數據是其他語言,也可以使用英語、日語、韓語、粵語與中文進行推理。
- 集成工具集:內建用於人聲伴奏分離、自動數據集分割與多語言 ASR (Fun-ASR, SenseVoice) 的工具。
- 多種模型版本:提供針對不同需求優化的各種版本(v1 到 v4 以及 v2Pro),例如更高的音訊保真度(v4 中的 48k 輸出)或更好的穩定性與情感表達(v3)。
- 高推理速度:針對快速生成進行了優化,並提供適用於 CPU 優化推理的特定版本。
相關
- 專案
- 專案
- 專案
- 專案
- 專案