teticio/audio-diffusion

Apply diffusion models using the new Hugging Face diffusers package to synthesize music instead of images.

What it solves

這項專案旨在透過將擴散模型(通常用於圖像生成技術)應用於音訊數據,實現音樂與音訊迴圈的合成。它提供了一個框架,可以用於訓練與使用能夠根據從音訊文件數據集中所學到的模式來生成新音訊樣本的模型。

How it works

音訊首先被轉換為 mel spectrograms(聲音的視覺化表示),並將其視為圖像。該專案使用幾種擴散技術來生成這些頻譜圖:

  • DDPM (De-noising Diffusion Probabilistic Models): 針對 mel spectrograms 進行訓練,以合成相似的頻譜圖,隨後將其轉換回音訊。
  • DDIM (De-noising Diffusion Implicit Models): 允許以較少的步數進行更快速的生成,並實現了用於在雜訊空間中對音訊樣本進行插值的確定性編碼。
  • Latent Audio Diffusion: 使用 Variational AutoEncoder (VAE) 將音訊壓縮至較低維度的潛在空間,使訓練與推理過程更加快速且高效。
  • Conditional Generation: 允許模型根據特定的編碼(例如文字或音訊特徵)來生成音訊,以影響輸出結果。

Who it’s for

它適用於對生成式音訊、音樂合成與建立音訊變體或混音的音樂家、音訊工程師與 AI 研究人員。

Highlights

  • Flexible Generation: 支援從頭開始生成音訊、為現有曲目進行變體創作,或透過遮罩輸入音訊的部分內容來進行「out-painting」作業。
  • Slerp Interpolation: 能夠在潛在空間中對兩個不同的音訊樣本進行插值。
  • Pre-trained Models: 包含各種針對不同流派的預訓練模型,例如 Instrumental Hip Hop 與 Spotify-liked playlists。
  • Integration: 已遷移至 Hugging Face 的 diffusers 套件,以便於使用與貢獻。

相關

  • 專案
  • 專案
  • 專案
  • 專案