voicepaw/so-vits-svc-fork

so-vits-svc fork with realtime support, improved interface and more features.

解決する課題

このプロジェクトは、歌唱音声変換のためのシステムを提供し、ソースオーディオファイルまたはライブマイク入力の音声を特定のターゲット話者の声に変換できるようにします。so-vits-svcをベースに、リアルタイム機能、より使いやすいインターフェース、および高速なトレーニングを追加して改良されています。

仕組み

音声変換にはVITSベースのアーキテクチャを使用しています。パイプラインには、オーディオの前処理(リサンプリング、分割、ダイアリゼーション)、HuBERTやCREPEなどのモデルを使用したピッチ推定のための特徴抽出、およびターゲット話者のデータセットでのモデルのトレーニングが含まれます。トレーニングが完了すると、コマンドラインインターフェース(CLI)またはグラフィカルユーザーインターフェース(GUI)を介して推論に使用でき、リアルタイムまたはファイルから音声を変換できます。

対象ユーザー

歌唱またはスピーチ用のボイスクローンを作成したいユーザー向けに設計されています。ワンクリックインストーラーとGUIを使用できる初心者から、ローカルGPUやGoogle Colab、Paperspaceなどのクラウド環境を使用して独自のモデルをトレーニングできる高度なユーザーまで幅広く対応しています。

ハイライト

  • リアルタイム変換: マイクからのライブ音声変換をサポート。
  • インターフェースの改善: 操作を容易にするために、GUIと統合されたCLIの両方を搭載。
  • 高速なトレーニング: トレーニング速度は元のリポジトリの約2倍です。
  • 簡素化されたインストール: pip経由で利用可能で、Windows用のワンクリック.batインストーラーが含まれています。
  • 精度の向上: より正確なピッチ推定のためにCREPEを使用し、以前のContentVecの誤用を修正しました。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト