gemelo-ai/vocos

Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis

解決的問題

Vocos 是一種神經聲碼器,旨在從聲學特徵(例如梅爾頻譜圖或 EnCodec 標記)中合成高品質的音訊波形。它旨在彌補時域與基於傅立葉變換的神經聲碼器之間的差距,提供快速且高保真的音訊重建。

工作原理

與傳統基於 GAN 的聲碼器在時域中建模音訊樣本不同,Vocos 生成的是頻譜係數。這些係數隨後透過逆傅立葉變換轉換為音訊波形,使模型能在單次前向傳播中生成音訊,實現快速重建。

適用對象

本工具適用於建構音訊合成系統、文字轉語音(TTS)流程的研究人員與開發者,或希望與其他音訊模型(如 Bark)整合的使用者。

主要亮點

  • 快速合成:單次前向傳播即可生成波形。
  • 頻譜域建模:使用頻譜係數與逆傅立葉變換,而非時域建模。
  • 基於 GAN 的訓練:使用生成對抗網路(GAN)目標函數進行訓練。
  • 靈活輸入:支援從梅爾頻譜圖與 EnCodec 標記中進行重建。

相關

  • 專案
  • 專案
  • 專案
  • 專案