ASLP-lab/MeanVC
A Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
解決的問題
MeanVC 解決了在實時情境下進行高保真、零次學習語音轉換的挑戰——在保持說話內容不變的情況下改變說話者的音色。它旨在降低基於擴散模型的語音轉換通常伴隨的計算開銷和延遲,使其輕量級到足以應用於串流情境。
工作原理
該系統使用擴散變壓器結合分塊自回歸去噪策略來處理串流音訊。為了實現快速生成,它採用「平均流」(mean flows)技術,使模型能夠在單一步驟中將起始點映射到終點,無需進行多輪迭代去噪。它可以在不針對特定說話者重新訓練的情況下,將源語音轉換為任何目標語音(零次學習)。
適用對象
此工具專為從事語音合成、實時音訊處理以及語音克隆應用的研究人員和開發者設計,適用於需要低延遲與高說話者相似度的場景。
主要特色
- 串流推論:透過分塊處理支援即時轉換,可使用麥克風輸入。
- 單步生成:相比傳統擴散模型,利用平均流實現快速推論。
- 零次學習能力:無需額外訓練即可將音色轉移到未見過的目標說話者。
- 輕量級架構:參數量顯著少於先前方法,同時維持高品質語音。
相關
- 專案
- 專案
- 專案
- 專案
- 專案