voicepaw/so-vits-svc-fork
so-vits-svc fork with realtime support, improved interface and more features.
解決的問題
本專案提供了一個歌唱語音轉換系統,允許使用者將來源音訊檔案或實時麥克風輸入的語音轉換為特定目標說話者的聲音。它透過增加實時功能、更具使用者友好的介面以及更快的訓練速度,對原始的 so-vits-svc 進行了改進。
工作原理
它使用基於 VITS 的架構進行語音轉換。流程包括音訊預處理(重採樣、分割與說話者日誌)、使用 HuBERT 或 CREPE 等模型進行音高估計的特徵提取,以及在目標說話者的數據集上訓練模型。訓練完成後,可以透過命令列介面 (CLI) 或圖形使用者介面 (GUI) 進行推論,從而實現實時或從檔案轉換音訊。
適用對象
專為想要建立用於唱歌或說話的語音克隆的使用者設計,範圍涵蓋從可以使用一鍵安裝程式與 GUI 的初學者,到可以使用本地 GPU 或 Google Colab 與 Paperspace 等雲端環境訓練自己模型的進階使用者。
亮點
- 實時轉換:支援來自麥克風的實時變聲。
- 改進的介面:包含 GUI 與統一的 CLI,以便於操作。
- 更快的訓練:訓練速度比原始儲存庫快約兩倍。
- 簡化的安裝:可透過
pip使用,並包含適用於 Windows 的一鍵式.bat安裝程式。 - 增強的準確性:使用 CREPE 進行更精確的音高估計,並修復了先前對 ContentVec 的誤用。
相關
- 專案
- 專案
- 專案
- 專案
- 專案