prophesier/diff-svc

Singing Voice Conversion via diffusion model

What it solves

元のメロディを維持しながら、歌声をある人から別の人へと変換(音色変換)することができ、基本的なピッチ補正もサポートしています。

How it works

このプロジェクトは、拡散モデルを使用して入力された歌声をターゲットの音色に変換します。音声処理には Hubert と ContentVec を使用し、さまざまな音声フォーマットとサンプリングレート(最大 44.1kHz)をサポートしています。

Who it’s for

AI による歌声変換および音色変換に関心のあるミュージシャン、オーディオエンジニア、研究者です。

Highlights

  • 44.1kHz の高忠実度オーディオをサポート。
  • 基本的なピッチ補正機能を搭載。
  • 幅広い入力および出力音声フォーマットをサポート。
  • 推論時に長い音声ファイルを自動的にスライスする機能を備えています。