voicepaw/so-vits-svc-fork
so-vits-svc fork with realtime support, improved interface and more features.
解決する課題
このプロジェクトは、歌唱音声変換のためのシステムを提供し、ソースオーディオファイルまたはライブマイク入力の音声を特定のターゲット話者の声に変換できるようにします。so-vits-svcをベースに、リアルタイム機能、より使いやすいインターフェース、および高速なトレーニングを追加して改良されています。
仕組み
音声変換にはVITSベースのアーキテクチャを使用しています。パイプラインには、オーディオの前処理(リサンプリング、分割、ダイアリゼーション)、HuBERTやCREPEなどのモデルを使用したピッチ推定のための特徴抽出、およびターゲット話者のデータセットでのモデルのトレーニングが含まれます。トレーニングが完了すると、コマンドラインインターフェース(CLI)またはグラフィカルユーザーインターフェース(GUI)を介して推論に使用でき、リアルタイムまたはファイルから音声を変換できます。
対象ユーザー
歌唱またはスピーチ用のボイスクローンを作成したいユーザー向けに設計されています。ワンクリックインストーラーとGUIを使用できる初心者から、ローカルGPUやGoogle Colab、Paperspaceなどのクラウド環境を使用して独自のモデルをトレーニングできる高度なユーザーまで幅広く対応しています。
ハイライト
- リアルタイム変換: マイクからのライブ音声変換をサポート。
- インターフェースの改善: 操作を容易にするために、GUIと統合されたCLIの両方を搭載。
- 高速なトレーニング: トレーニング速度は元のリポジトリの約2倍です。
- 簡素化されたインストール:
pip経由で利用可能で、Windows用のワンクリック.batインストーラーが含まれています。 - 精度の向上: より正確なピッチ推定のためにCREPEを使用し、以前のContentVecの誤用を修正しました。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト