High-Logic/Genie-TTS

GPT-SoVITS ONNX Inference Engine & Model Converter

解決する課題

GENIEは、高品質なテキスト読み上げ(TTS)合成をより速く、より使いやすくするために設計された軽量推論エンジンであり、特にCPUパフォーマンスの最適化に特化しています。元のGPT-SoVITSプロジェクトの重い依存関係を排除することで、強力なGPUを必要とせずに、ほぼ瞬時の音声生成を可能にします。

仕組み

GPT-SoVITSフレームワークをベースに構築されたGENIEは、元のPyTorchモデルを最適化されたONNX形式に変換します。キャラクター音声モデルの読み込み、感情やイントネーションのクローニングのための参照オーディオの設定、および音声生成のための簡素化されたPython APIを提供します。また、TTSエンジンをAPIとしてデプロイするための組み込みFastAPIサーバーも含まれています。

対象者

CPUベースのシステムにおいて、モデルサイズが大きいことや高レイテンシによるオーバーヘッドを気にすることなく、高品質な多言語TTSをアプリケーションに統合したい開発者やクリエイター。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト