sp-uhh/sgmse

Score-based Generative Models (Diffusion Models) for Speech Enhancement and Dereverberation

What it solves

このプロジェクトは、音声強調とデリバーブ除去のフレームワークを提供し、オーディオ信号からノイズと残響を除去してクリーンな音声を復元する課題に取り組みます。拡散ベースの生成モデルを用いた複数の研究論文を実装しています。

How it works

システムは拡散ベースの生成モデル(具体的にはスコアベース生成モデル)を、複素短時間フーリエ変換(STFT)領域で動作させます。クリーンな音声スペクトログラムに徐々にノイズを加える前方プロセスと、劣化した信号からクリーンな音声を反復的に生成する逆プロセスを学習します。

Who it’s for

主に音声信号処理や機械学習コミュニティの研究者・開発者向けです。音声復元、オーディオ向け生成 AI、拡散モデルに取り組んでいる方に適しています。

Highlights

  • Multiple Model Architectures: ncsnppdcunetncsnpp_v2 など、さまざまなバックボーンをサポート。
  • Comprehensive Pretrained Checkpoints: VoiceBank‑DEMAND、WSJ0‑CHiME3、EARS などのデータセットで学習された、強調とデリバーブ除去用のチェックポイントを提供。
  • Fullband Support: 48 kHz オーディオを扱えるモデルを含む。
  • Evaluation Tools: 強化音声ファイルの生成や、性能測定のためのインストゥルメンタル指標計算スクリプトを提供。
  • Advanced Generative Approaches: Schrödinger bridge モデルを実装し、音声復元のための様々なトレーニング目的を検証。