Spr-Aachen/Easy-Voice-Toolkit

A user-friendly toolkit for voice recgonition/transcription/conversion etc. | 简单易用的语音工具箱

Easy Voice Toolkit – クイック概要

これは何か – デスクトップと Colab を組み合わせたツールキットで、複数のオープンソース音声関連モデル(例:文字起こし用の Whisper、音声変換用の GPT-SoVITS)とユーティリティを連携させ、生の音声を取得して、クリーニング、文字起こし、データセット構築、音声変換モデルのトレーニング、そして最終的に変換音声の生成を行うことができます。このプロジェクトには、すぐに実行できる Windows ポータブルパッケージが含まれており、クラウドベースの使用のための Jupyter ノートブックも提供されています。

主な機能

  • 音声処理 – トリミング、スライス、フォーマット処理。
  • 音声認識と文字起こし – OpenAI の Whisper を搭載。
  • データセット作成 – 音声変換トレーニング用のペア音声を準備するツール。
  • モデルトレーニング – GPT-SoVITS パイプラインをラップして新しい音声モデルをトレーニングするスクリプト。
  • 音声変換 – 入力話者の音声を、トレーニングされたターゲット音声のスタイルに変換します。

始め方

  1. Windows ユーザーWindows ポータブルパッケージをダウンロード バッジをクリックし、解凍して run.py を実行します(Python のインストールは不要)。
  2. Colab ユーザー – バッジから Google Colab Demo ノートブックを開き、セルに従って依存関係をインストールし、クラウドで同じワークフローを実行します。
  3. 開発者 – リポジトリをクローンし(サブモジュール含む)、Python ≥ 3.8 をインストールし、CUDA バージョンに一致する PyTorch をインストールしてから、pip install -r requirements.txtpip install QEasyWidgets を実行します。run.py を実行して GUI クライアントとバックエンドサーバーを起動します。

典型的なワークフロー

  1. 生の音声をインポート → オプションでクリーニング/スライス。
  2. Whisper で文字起こしし、テキストの書き起こしを取得します。
  3. ペアデータセットを作成(ソース音声 + ターゲット音声サンプル)。
  4. そのデータセットで GPT-SoVITS 音声変換モデルをトレーニングします。
  5. 新しい発話を変換し、ターゲット音声のように聞こえる音声を生成します。

法的 / 使用上の注意

  • 学術および学習目的のみを対象としており、本番環境での使用は想定していません。
  • 結果(例:動画)を公開する場合は、ソース音声を開示し、元の作成者とこのリポジトリにクレジットを付与する必要があります。
  • 著者は、商業的または非研究目的でこのツールキットを使用する前に、連絡するよう求めています。

ロードマップ

  • インタラクティブな音声アシスタント機能のためのチャットボット(LLM)統合を計画中。
  • クライアント UI を C++/Qt にリファクタリングし、パフォーマンスを向上。
  • バックエンドの継続的な作業と、今後の Linux サポート。

謝辞(上流プロジェクト) – audio-slicer、VoiceprintRecognition-Pytorch、OpenAI Whisper、SRT-to-CSV-and-audio-split、GPT-SoVITS。


上記のすべての情報はリポジトリの README から直接取得したものであり、追加の機能は推測されていません。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト