lenML/Speech-AI-Forge
🍦 Speech-AI-Forge is a project developed around TTS generation model, implementing an API Server and a Gradio-based WebUI.
解決する課題
Speech-AI-Forgeは、多種多様な最先端のテキスト読み上げ(TTS)および自動音声認識(ASR)モデルに対して、統一されたインターフェースとデプロイメントフレームワークを提供します。これにより、異なる音声AIモデルごとに個別のリポジトリをインストールして管理する必要がなくなり、音声生成、クローニング、文字起こしのための集中ハブとして機能します。
仕組み
このプロジェクトは、複数の音声モデルをラップするAPIサーバーとGradioベースのWebUIを実装しています。ChatTTS、CosyVoice、FishSpeech、GPT-SoVITS、F5-TTS、Qwen3-TTSなどの幅広いモデルに加え、WhisperやSenseVoiceのようなASRモデルもサポートしています。ユーザーは、Windowsスタンドアロンパッケージ、Google Colab、Docker、またはローカルインストールを通じてデプロイ可能です。
対象ユーザー
複数の個別のモデル環境を管理する複雑さを回避しつつ、高品質なAI音声合成および文字起こしサービスを必要とする開発者やクリエイター向けに設計されています。
ハイライト
- マルチモデル対応: 数多くのTTSエンジン(例:ChatTTS、CosyVoice、F5-TTS)とASRエンジン(Whisper、SenseVoice)を統合。
- 高度な音声制御: 話者切り替え、カスタム音声のアップロード、リファレンスベースのクローニング、およびスタイル制御機能を搭載。
- SSMLサポート: 長文合成、ポッドキャストスタイルのマルチロールオーディオ、字幕から音声への生成のための微細な制御ツールを含む。
- 音声管理: カスタム音声の作成、ブレンド、テストのためのツール(音声リソース専用ハブを含む)。
- 包括的なツール群: 音声エンハンサー(ResembleEnhance)およびオーディオのクリッピングや調整のためのポストプロセッシングツールを含む。
- 柔軟なデプロイ: インタラクティブな使用のためのフルWebUIと、高スループットアプリケーションのためのスタンドアロンAPIサーバーの両方を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト