sp-uhh/sgmse

Score-based Generative Models (Diffusion Models) for Speech Enhancement and Dereverberation

What it solves

이 프로젝트는 음성 향상 및 디레버브를 위한 프레임워크를 제공하여, 오디오 신호에서 잡음과 잔향을 제거하고 깨끗한 음성을 복원하는 문제를 해결합니다. 확산 기반 생성 모델을 활용한 여러 연구 논문을 구현했습니다.

How it works

시스템은 확산 기반 생성 모델(구체적으로는 스코어 기반 생성 모델)을 복소수 단시간 푸리에 변환(STFT) 영역에서 동작시킵니다. 깨끗한 음성 스펙트로그램에 점진적으로 잡음을 추가하는 전방 과정과, 손상된 신호로부터 깨끗한 음성을 반복적으로 생성하는 역방 과정을 학습합니다.

Who it’s for

주로 오디오 신호 처리 및 머신러닝 커뮤니티의 연구자와 개발자를 대상으로 하며, 음성 복원, 오디오 생성 AI, 확산 모델에 관심 있는 분들에게 적합합니다.

Highlights

  • Multiple Model Architectures: ncsnpp, dcunet, ncsnpp_v2 등 다양한 백본을 지원합니다.
  • Comprehensive Pretrained Checkpoints: VoiceBank‑DEMAND, WSJ0‑CHiME3, EARS 등 데이터셋으로 학습된 강화 및 디레버브용 체크포인트를 제공합니다.
  • Fullband Support: 48 kHz 오디오를 처리할 수 있는 모델을 포함합니다.
  • Evaluation Tools: 향상된 오디오 파일을 생성하고 성능을 측정하기 위한 계량 지표를 계산하는 스크립트를 제공합니다.
  • Advanced Generative Approaches: Schrödinger bridge 모델을 구현하고, 음성 복원을 위한 다양한 학습 목표를 탐구합니다.