sp-uhh/sgmse

Score-based Generative Models (Diffusion Models) for Speech Enhancement and Dereverberation

What it solves

本项目提供一个语音增强与去混响的框架,解决从音频信号中去除噪声和混响以恢复清晰语音的问题。它实现了多篇研究论文,利用扩散式生成模型来完成此类恢复。

How it works

系统使用基于扩散的生成模型(具体为分数基生成模型),在复数短时傅里叶变换(STFT)域上运行。它采用前向过程逐步将噪声加入干净语音的谱图,并通过逆向过程学习如何从受损信号迭代生成干净语音。

Who it’s for

此项目主要面向音频信号处理和机器学习社区的研究者与开发者,特别是从事语音恢复、音频生成式 AI 与扩散模型相关工作的用户。

Highlights

  • Multiple Model Architectures: 支持多种骨干模型,如 ncsnppdcunetncsnpp_v2
  • Comprehensive Pretrained Checkpoints: 提供针对不同任务(增强和去混响)的检查点,训练数据集包括 VoiceBank‑DEMAND、WSJ0‑CHiME3 与 EARS。
  • Fullband Support: 包含能够处理 48 kHz 音频的模型。
  • Evaluation Tools: 包含生成增强音频文件和计算仪器指标以衡量性能的脚本。
  • Advanced Generative Approaches: 实现 Schrödinger bridge 模型,并探讨不同的训练目标以提升语音恢复效果。