teticio/audio-diffusion

Apply diffusion models using the new Hugging Face diffusers package to synthesize music instead of images.

它解决了什么问题

该项目通过将通常用于图像生成的扩散模型技术应用于音频数据,实现了音乐和音频循环的合成。它提供了一个框架,用于训练和使用能够基于音频文件数据集中的学习模式生成新音频样本的模型。

它如何工作

音频首先被转换为梅尔频谱图(声音的视觉表示),这些频谱图被视为图像。该项目使用多种扩散技术来生成这些频谱图:

  • DDPM(去噪扩散概率模型): 在梅尔频谱图上进行训练,以合成类似的频谱图,然后将其转换回音频。
  • DDIM(去噪扩散隐式模型): 允许以更少的步骤实现更快的生成,并支持在噪声空间中对音频样本进行插值的确定性编码。
  • 潜在音频扩散: 使用变分自编码器(VAE)将音频压缩到低维潜在空间,使训练和推理更快、更高效。
  • 条件生成: 允许模型根据特定编码(如文本或音频特征)生成音频,以影响输出结果。

适合谁

专为对生成音频、音乐合成以及创建音频变体或混音感兴趣的音乐家、音频工程师和人工智能研究人员设计。

主要亮点

  • 灵活生成: 支持从头生成音频、创建现有曲目的变体,或通过遮蔽输入音频的部分实现“外绘”(out-painting)。
  • 球面线性插值(Slerp): 可在潜在空间中对两个不同的音频样本进行插值。
  • 预训练模型: 包含针对不同流派的多种预训练模型,例如器乐嘻哈和Spotify喜欢的播放列表。
  • 集成: 已迁移到 Hugging Face diffusers 包,便于使用和贡献。

一个将梅尔频谱图视为图像的基于扩散的音乐合成框架,能够生成高质量的音频。 — @username

相关

  • 项目
  • 项目
  • 项目
  • 项目