RVC-Project/Retrieval-based-Voice-Conversion-WebUI
Easily train a good VC model with voice data <= 10 mins!
解決的問題
本專案提供一個簡單且易於使用的語音音色轉換與語音變聲框架。它能保持原始語音模式的同時,將來源語音轉換為目標語音,有效扮演高品質語音變聲器的角色。
工作原理
系統採用基於檢索的方法,以訓練資料集中的特徵(top1 檢索)取代輸入來源特徵,防止音色洩漏。利用 RMVPE(InterSpeech2023)音高提取演算法消除靜音部分,確保快速且低資源消耗的處理。框架亦內建人聲分離工具(透過 pymss/MSST)與模型合併功能,以調整音色。
適用對象
專為希望以最少資料(僅需10分鐘低雜訊音訊)訓練個人語音模型,並進行離線轉換或即時語音變聲的創作者與開發者所設計。
主要亮點
- 低延遲:實現端對端延遲170ms,使用 ASIO 裝置可降低至90ms。
- 高效訓練:即使在低階GPU上也能快速訓練。
- 高品質:使用 RMVPE 進行精確音高提取,並透過 top1 檢索確保語音一致性。
- 易用性:內建使用者友善的 WebUI,支援多種硬體組態,包括 NVIDIA、AMD 與 Intel(透過 DirectML/CPU)。
- 整合工具:內建支援從伴奏中分離人聲。
相關
- 專案
- 專案
- 專案
- 專案
- 專案