gemelo-ai/vocos

Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis

解决的问题

Vocos 是一种神经声码器,旨在从声学特征(如梅尔频谱图或 EnCodec 令牌)中合成高质量的音频波形。它旨在弥合时域与基于傅里叶变换的神经声码器之间的差距,提供快速且高保真的音频重建。

工作原理

与传统基于 GAN 的声码器在时域中建模音频样本不同,Vocos 生成的是频谱系数。这些系数随后通过逆傅里叶变换转换为音频波形,使模型能够在单次前向传播中生成音频,实现快速重建。

适用人群

本工具适用于构建音频合成系统、文本转语音(TTS)流程的研究人员和开发者,或希望与其他音频模型(如 Bark)集成的用户。

主要亮点

  • 快速合成:单次前向传播即可生成波形。
  • 频谱域建模:使用频谱系数和逆傅里叶变换,而非时域建模。
  • 基于 GAN 的训练:使用生成对抗网络(GAN)目标函数进行训练。
  • 灵活输入:支持从梅尔频谱图和 EnCodec 令牌中进行重建。

相关

  • 项目
  • 项目
  • 项目
  • 项目