yxlllc/DDSP-SVC
Real-time end-to-end singing voice conversion system based on DDSP (Differentiable Digital Signal Processing)
解決的問題
DDSP-SVC 提供了一種比傳統高品質方法高效得多的歌唱音色轉換(AI語音變換)方式。它解決了 SO-VITS-SVC 等專案所面臨的高硬體需求與長時間訓練的問題,使在一般個人電腦上實現高品質語音合成成為可能。
工作原理
此專案使用可微分數位訊號處理(DDSP),並透過先進模型提升輸出品質。目前版本採用修正流模型(rectified-flow model)來提高合成品質。流程包括:
- 預處理:使用 ContentVec 或 HubertSoft 等編碼器從音訊中提取特徵,並透過 RMVPE 進行音高提取。
- 訓練:在特定語音資料集(單語者或多人)上訓練模型。
- 合成:使用非即時處理或即時 GUI 將輸入語音轉換為目標語音,透過滑動視窗、交叉淡入淡出與基於 SOLA 的拼接技術,維持低延遲。
適用對象
適合希望建立 AI 語音變換器或歌唱音色轉換,但缺乏專業級 GPU 硬體或無法投入長時間訓練週期的使用者。
主要亮點
- 低資源消耗:相比 SO-VITS-SVC,訓練與合成所需的硬體要求大幅降低。
- 快速訓練:訓練速度比傳統方法快數個數量級,與 RVC 相當。
- 高品質合成:透過使用修正流模型與預訓練聲碼器,實現與 SO-VITS-SVC 和 RVC 相媲美的合成品質。
- 靈活合成:支援高保真非即時轉換與低延遲即時語音變換。
- 多語者支援:可訓練單一模型,實現不同語者音色之間的切換或混合。
相關
- 專案
- 專案
- 專案
- 專案
- 專案