RVC-Project/Retrieval-based-Voice-Conversion-WebUI
Easily train a good VC model with voice data <= 10 mins!
何を解決するか
このプロジェクトは、音声のトーン変換と音声変更を簡単かつ使いやすくするフレームワークを提供します。元の発話パターンを維持しながら、ソース音声をターゲット音声に変換でき、高品質な音声チェンジャーとして機能します。
動作方法
システムは、入力のソース特徴をトレーニングデータセットから取得した特徴(top1リトリーブ)で置き換えるリトリーブベースのアプローチを使用し、トーン漏れを防ぎます。RMVPE(InterSpeech2023)のピッチ抽出アルゴリズムを活用して、無音部分を排除し、高速かつ低リソースでの処理を実現します。また、音声分離(pymss/MSST経由)やモデルマージ機能を備えており、トーンの調整が可能です。
対象ユーザー
最小限のデータ(10分程度の低ノイズ音声)で独自の音声モデルをトレーニングしたいクリエイターおよび開発者向けに設計されています。オフライン変換またはリアルタイム音声変更が可能です。
特徴
- 低遅延: エンドツーエンドの遅延が170msで、ASIOデバイスを使用すれば90msまで短縮可能。
- 効率的なトレーニング: 低スペックGPUでも高速トレーニングが可能。
- 高品質: RMVPEによる正確なピッチ抽出とtop1リトリーブにより、音声の一貫性を確保。
- アクセスしやすさ: ユーザーに優しいWebUIを備え、NVIDIA、AMD、Intel(DirectML/CPU経由)を含む複数のハードウェア構成に対応。
- 統合ツール: アコースティックとボーカルの分離を内蔵サポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト