teticio/audio-diffusion

Apply diffusion models using the new Hugging Face diffusers package to synthesize music instead of images.

What it solves

このプロジェクトは、通常画像生成に使用される拡散モデル(diffusion models)をオーディオデータに適用することで、音楽とオーディオループの合成を可能にします。データセット内のオーディオファイルから学習したパターンに基づき、新しいオーディオサンプルを生成できるモデルを訓練・使用するためのフレームワークを提供します。

How it works

オーディオはまずメルスペクトログラム(音の視覚的表現)に変換され、画像として扱われます。このプロジェクトでは、いくつかの拡散技術を使用してこれらのスペクトログラムを生成します:

  • DDPM (De-noising Diffusion Probabilistic Models): メルスペクトログラム上で訓練を行い、類似のものを合成し、それをオーディオに変換します。
  • DDIM (De-noising Diffusion Implicit Models): より少ないステップ数でより高速な生成を可能にし、決定論的なエンコーディングによりノイズ空間におけるオーディオサンプルの補間を可能にします。
  • Latent Audio Diffusion: Variational AutoEncoder (VAE) を使用してオーディオを低次元の潜在空間に圧縮し、訓練と推論をより高速かつ効率的に行います。
  • Conditional Generation: 特定のエンコーディング(テキストやオーディオ特徴量など)に基づいてオーディオを生成することを可能にし、出力を制御します。

Who it’s for

音楽家、オーディオエンジニア、AI研究者など、生成的なオーディオ、音楽合成、オーディオのバリエーションやリミックスを作成することに関心のある人々を対象としています。

Highlights

  • Flexible Generation: 音源からゼロから生成、既存の曲のバリエーション作成、または入力オーディオの一部をマスクして「out-painting」を行うことが可能です。
  • Slerp Interpolation: 潜在空間における2つの異なるオーディオサンプルの間を補間できます。
  • Pre-trained Models: Instrumental Hip Hop や Spotify-liked playlists のような、異なるジャンルのための様々なプリトレーニング済みモデルが含まれています。
  • Integration: Hugging Face の diffusers パッケージに移行されたため、より使いやすく、貢献しやすくなっています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト