sp-uhh/sgmse

Score-based Generative Models (Diffusion Models) for Speech Enhancement and Dereverberation

What it solves

本專案提供一個語音增強與去混響的框架,解決從音訊信號中去除噪音與混響以恢復乾淨語音的問題。它實作了多篇研究論文,利用擴散式生成模型來完成此類恢復。

How it works

系統使用基於擴散的生成模型(具體為分數基生成模型),在複數短時傅立葉變換(STFT)域上運作。它採用前向過程逐步將噪音加入乾淨語音的頻譜圖,並透過逆向過程學習如何從受損信號迭代產生乾淨語音。

Who it’s for

此專案主要面向音訊信號處理與機器學習社群的研究者與開發者,特別是從事語音復原、音訊生成式 AI 與擴散模型相關工作的使用者。

Highlights

  • Multiple Model Architectures: 支援多種骨幹模型,如 ncsnppdcunetncsnpp_v2
  • Comprehensive Pretrained Checkpoints: 提供針對不同任務(增強與去混響)的檢查點,訓練資料集包括 VoiceBank‑DEMAND、WSJ0‑CHiME3 與 EARS。
  • Fullband Support: 包含能處理 48 kHz 音訊的模型。
  • Evaluation Tools: 含有產生增強音訊檔案與計算儀器指標以衡量效能的腳本。
  • Advanced Generative Approaches: 實作 Schrödinger bridge 模型,並探討不同的訓練目標以提升語音復原效果。