gemelo-ai/vocos

Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis

何を解決するか

Vocos は、音声特徴(メルスペクトログラムや EnCodec トークンなど)から高品質な音声波形を合成するためのニューラルボコーダーです。時間領域とフーリエベースのニューラルボコーダーのギャップを埋め、高速かつ高忠実度の音声再構成を実現することを目指しています。

動作方法

従来の GAN ベースのボコーダーが時間領域で音声サンプルをモデル化するのに対し、Vocos はスペクトル係数を生成します。これらの係数は逆フーリエ変換を使用して音声波形に変換され、1回の順伝播で音声を生成できるため、高速な再構成が可能になります。

対象ユーザー

音声合成システムの開発者や研究者、テキストから音声(TTS)パイプラインの構築者、または Bark などの他の音声モデルと統合したい開発者向けです。

特徴

  • 高速合成: 1回の順伝播で波形を生成します。
  • スペクトル領域モデリング: 時間領域モデリングではなく、スペクトル係数と逆フーリエ変換を使用します。
  • GANベースの学習: 生成的敵対ネットワーク(GAN)の目的関数を使用して学習されています。
  • 柔軟な入力: メルスペクトログラムと EnCodec トークンの両方からの再構成をサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト