MoonInTheRiver/DiffSinger

DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism (SVS & TTS); AAAI 2022; Official code

What it solves

DiffSingerは、高品質な歌声合成 (SVS) およびテキスト読み上げ (TTS) 生成の課題を解決するために設計されています。歌詞と音高情報からオーディオ波形を生成するために、拡散モデルベースのアプローチを採用することで、より自然で表現力豊かな歌声を提供することを目指しています。

How it works

このプロジェクトは、歌詞、MIDI、または実測音高 (ground-truth F0) データなどの入力から mel-spectrograms を生成するために、「浅層拡散メカニズム」(shallow diffusion mechanism) を実装しています。使用するパイプラインに応じて、音高を明示的または暗黙的に予測できます。生成された mel-spectrograms は、その後、HiFiGAN や NSF-HiFiGAN などのボコーダー (vocoders) を使用して、聴取可能な波形に変換されます。

Who it’s for

オーディオ合成、音楽生成 AI、および音声合成 (TTS) に携わる研究者や開発者が、拡散モデルベースのオーディオ生成を実装または実験したい場合に適しています。

Highlights

  • Dual Capability: 歌声合成 (SVS) とテキスト読み上げ (TTS) の両方をサポートしています。
  • Flexible Pipelines: 音高の処理 (明示的 vs. 暗黙的予測) と入力タイプ (MIDI, 歌詞, および実測音高 F0) に対して、複数の構成を提供します。
  • Acceleration: 合成プロセスを加速させるための PNDM (Pseudo Numerical Methods for Diffusion Models) 用のプラグインが含まれています。
  • Integration: 高忠実度なオーディオ出力のために、HiFiGAN や NSF-HiFiGAN などの業界標準のボコーダー (vocoders) を使用しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト