yxlllc/DDSP-SVC

Real-time end-to-end singing voice conversion system based on DDSP (Differentiable Digital Signal Processing)

何を解決するか

DDSP-SVCは、従来の高品質な方法と比べてはるかに効率的な歌唱音声変換(AIボイスチェンジ)を実現する手法を提供します。SO-VITS-SVCなどのプロジェクトで見られる高コストなハードウェア要件と長時間の学習時間を克服し、標準的な個人用コンピュータでも高品質な音声合成を可能にします。

仕組み

このプロジェクトは微分可能なデジタル信号処理(DDSP)を使用し、高度なモデルで出力品質を向上させます。現在のバージョンでは、合成品質を向上させるためにリクティファイドフロー(rectified-flow)モデルを採用しています。プロセスは以下の通りです:

  1. 前処理:ContentVecやHubertSoftなどのエンコーダーで音声から特徴量を抽出し、RMVPEによるピッチ抽出を行います。
  2. 学習:特定のボイスデータセット(単一または複数話者)上でモデルを学習します。
  3. 合成:非リアルタイム処理またはリアルタイムGUIを使用して入力ボイスをターゲットボイスに変換します。スライディングウィンドウ、クロスフェーディング、SOLAベースのスプライシングを用いて低レイテンシを維持します。

対象ユーザー

プロフェッショナルグレードのGPUハードウェアがなく、長時間の学習サイクルに時間を割けないAIボイスチェンジャーまたは歌唱音声変換の作成を希望するユーザー向けです。

特徴

  • 低リソース使用:SO-VITS-SVCと比べて、学習および合成に必要なハードウェア要件が大幅に低い。
  • 高速学習:学習速度が桁違いに速く、RVCと同等の性能を発揮。
  • 高品質:リクティファイドフローモデルと事前学習済みボコーダーの活用により、SO-VITS-SVCやRVCと競合する合成品質を実現。
  • 柔軟な合成:高精細な非リアルタイム変換と低レイテンシのリアルタイムボイスチェンジの両方をサポート。
  • マルチスピーカー対応:1つのモデルで複数話者の音色を切り替えたり、混合したりできる能力を備える。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト