High-Logic/Genie-TTS
GPT-SoVITS ONNX Inference Engine & Model Converter
解決する課題
GENIEは、高品質なテキスト読み上げ(TTS)合成をより速く、より使いやすくするために設計された軽量推論エンジンであり、特にCPUパフォーマンスの最適化に特化しています。元のGPT-SoVITSプロジェクトの重い依存関係を排除することで、強力なGPUを必要とせずに、ほぼ瞬時の音声生成を可能にします。
仕組み
GPT-SoVITSフレームワークをベースに構築されたGENIEは、元のPyTorchモデルを最適化されたONNX形式に変換します。キャラクター音声モデルの読み込み、感情やイントネーションのクローニングのための参照オーディオの設定、および音声生成のための簡素化されたPython APIを提供します。また、TTSエンジンをAPIとしてデプロイするための組み込みFastAPIサーバーも含まれています。
対象者
CPUベースのシステムにおいて、モデルサイズが大きいことや高レイテンシによるオーバーヘッドを気にすることなく、高品質な多言語TTSをアプリケーションに統合したい開発者やクリエイター。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト