yxlllc/DDSP-SVC

Real-time end-to-end singing voice conversion system based on DDSP (Differentiable Digital Signal Processing)

解決的問題

DDSP-SVC 提供了一種比傳統高品質方法高效得多的歌唱音色轉換(AI語音變換)方式。它解決了 SO-VITS-SVC 等專案所面臨的高硬體需求與長時間訓練的問題,使在一般個人電腦上實現高品質語音合成成為可能。

工作原理

此專案使用可微分數位訊號處理(DDSP),並透過先進模型提升輸出品質。目前版本採用修正流模型(rectified-flow model)來提高合成品質。流程包括:

  1. 預處理:使用 ContentVec 或 HubertSoft 等編碼器從音訊中提取特徵,並透過 RMVPE 進行音高提取。
  2. 訓練:在特定語音資料集(單語者或多人)上訓練模型。
  3. 合成:使用非即時處理或即時 GUI 將輸入語音轉換為目標語音,透過滑動視窗、交叉淡入淡出與基於 SOLA 的拼接技術,維持低延遲。

適用對象

適合希望建立 AI 語音變換器或歌唱音色轉換,但缺乏專業級 GPU 硬體或無法投入長時間訓練週期的使用者。

主要亮點

  • 低資源消耗:相比 SO-VITS-SVC,訓練與合成所需的硬體要求大幅降低。
  • 快速訓練:訓練速度比傳統方法快數個數量級,與 RVC 相當。
  • 高品質合成:透過使用修正流模型與預訓練聲碼器,實現與 SO-VITS-SVC 和 RVC 相媲美的合成品質。
  • 靈活合成:支援高保真非即時轉換與低延遲即時語音變換。
  • 多語者支援:可訓練單一模型,實現不同語者音色之間的切換或混合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案