ASLP-lab/MeanVC

A Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows

解決的問題

MeanVC 解決了在實時情境下進行高保真、零次學習語音轉換的挑戰——在保持說話內容不變的情況下改變說話者的音色。它旨在降低基於擴散模型的語音轉換通常伴隨的計算開銷和延遲,使其輕量級到足以應用於串流情境。

工作原理

該系統使用擴散變壓器結合分塊自回歸去噪策略來處理串流音訊。為了實現快速生成,它採用「平均流」(mean flows)技術,使模型能夠在單一步驟中將起始點映射到終點,無需進行多輪迭代去噪。它可以在不針對特定說話者重新訓練的情況下,將源語音轉換為任何目標語音(零次學習)。

適用對象

此工具專為從事語音合成、實時音訊處理以及語音克隆應用的研究人員和開發者設計,適用於需要低延遲與高說話者相似度的場景。

主要特色

  • 串流推論:透過分塊處理支援即時轉換,可使用麥克風輸入。
  • 單步生成:相比傳統擴散模型,利用平均流實現快速推論。
  • 零次學習能力:無需額外訓練即可將音色轉移到未見過的目標說話者。
  • 輕量級架構:參數量顯著少於先前方法,同時維持高品質語音。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案