RVC-Project/Retrieval-based-Voice-Conversion-WebUI

Easily train a good VC model with voice data <= 10 mins!

解決的問題

本專案提供一個簡單且易於使用的語音音色轉換與語音變聲框架。它能保持原始語音模式的同時,將來源語音轉換為目標語音,有效扮演高品質語音變聲器的角色。

工作原理

系統採用基於檢索的方法,以訓練資料集中的特徵(top1 檢索)取代輸入來源特徵,防止音色洩漏。利用 RMVPE(InterSpeech2023)音高提取演算法消除靜音部分,確保快速且低資源消耗的處理。框架亦內建人聲分離工具(透過 pymss/MSST)與模型合併功能,以調整音色。

適用對象

專為希望以最少資料(僅需10分鐘低雜訊音訊)訓練個人語音模型,並進行離線轉換或即時語音變聲的創作者與開發者所設計。

主要亮點

  • 低延遲:實現端對端延遲170ms,使用 ASIO 裝置可降低至90ms。
  • 高效訓練:即使在低階GPU上也能快速訓練。
  • 高品質:使用 RMVPE 進行精確音高提取,並透過 top1 檢索確保語音一致性。
  • 易用性:內建使用者友善的 WebUI,支援多種硬體組態,包括 NVIDIA、AMD 與 Intel(透過 DirectML/CPU)。
  • 整合工具:內建支援從伴奏中分離人聲。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案