lenML/Speech-AI-Forge

🍦 Speech-AI-Forge is a project developed around TTS generation model, implementing an API Server and a Gradio-based WebUI.

解決する課題

Speech-AI-Forgeは、多種多様な最先端のテキスト読み上げ(TTS)および自動音声認識(ASR)モデルに対して、統一されたインターフェースとデプロイメントフレームワークを提供します。これにより、異なる音声AIモデルごとに個別のリポジトリをインストールして管理する必要がなくなり、音声生成、クローニング、文字起こしのための集中ハブとして機能します。

仕組み

このプロジェクトは、複数の音声モデルをラップするAPIサーバーとGradioベースのWebUIを実装しています。ChatTTS、CosyVoice、FishSpeech、GPT-SoVITS、F5-TTS、Qwen3-TTSなどの幅広いモデルに加え、WhisperやSenseVoiceのようなASRモデルもサポートしています。ユーザーは、Windowsスタンドアロンパッケージ、Google Colab、Docker、またはローカルインストールを通じてデプロイ可能です。

対象ユーザー

複数の個別のモデル環境を管理する複雑さを回避しつつ、高品質なAI音声合成および文字起こしサービスを必要とする開発者やクリエイター向けに設計されています。

ハイライト

  • マルチモデル対応: 数多くのTTSエンジン(例:ChatTTS、CosyVoice、F5-TTS)とASRエンジン(Whisper、SenseVoice)を統合。
  • 高度な音声制御: 話者切り替え、カスタム音声のアップロード、リファレンスベースのクローニング、およびスタイル制御機能を搭載。
  • SSMLサポート: 長文合成、ポッドキャストスタイルのマルチロールオーディオ、字幕から音声への生成のための微細な制御ツールを含む。
  • 音声管理: カスタム音声の作成、ブレンド、テストのためのツール(音声リソース専用ハブを含む)。
  • 包括的なツール群: 音声エンハンサー(ResembleEnhance)およびオーディオのクリッピングや調整のためのポストプロセッシングツールを含む。
  • 柔軟なデプロイ: インタラクティブな使用のためのフルWebUIと、高スループットアプリケーションのためのスタンドアロンAPIサーバーの両方を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト