RVC-Project/Retrieval-based-Voice-Conversion-WebUI

Easily train a good VC model with voice data <= 10 mins!

何を解決するか

このプロジェクトは、音声のトーン変換と音声変更を簡単かつ使いやすくするフレームワークを提供します。元の発話パターンを維持しながら、ソース音声をターゲット音声に変換でき、高品質な音声チェンジャーとして機能します。

動作方法

システムは、入力のソース特徴をトレーニングデータセットから取得した特徴(top1リトリーブ)で置き換えるリトリーブベースのアプローチを使用し、トーン漏れを防ぎます。RMVPE(InterSpeech2023)のピッチ抽出アルゴリズムを活用して、無音部分を排除し、高速かつ低リソースでの処理を実現します。また、音声分離(pymss/MSST経由)やモデルマージ機能を備えており、トーンの調整が可能です。

対象ユーザー

最小限のデータ(10分程度の低ノイズ音声)で独自の音声モデルをトレーニングしたいクリエイターおよび開発者向けに設計されています。オフライン変換またはリアルタイム音声変更が可能です。

特徴

  • 低遅延: エンドツーエンドの遅延が170msで、ASIOデバイスを使用すれば90msまで短縮可能。
  • 効率的なトレーニング: 低スペックGPUでも高速トレーニングが可能。
  • 高品質: RMVPEによる正確なピッチ抽出とtop1リトリーブにより、音声の一貫性を確保。
  • アクセスしやすさ: ユーザーに優しいWebUIを備え、NVIDIA、AMD、Intel(DirectML/CPU経由)を含む複数のハードウェア構成に対応。
  • 統合ツール: アコースティックとボーカルの分離を内蔵サポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト