rsxdalv/TTS-WebUI

A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!

解決する課題

TTS WebUIは、膨大な数のテキスト読み上げ(TTS)、音声生成、および音声変換ツールとやり取りするための、統合されたユーザーフレンドリーなインターフェースを提供します。これにより、依存関係の競合や複雑なセットアッププロセスを伴う、複数の個別のAI音声プロジェクトをインストールして管理する必要性がなくなります。

仕組み

このプロジェクトは、多数のオープンソースAI音声モデルのラッパーおよびマネージャーとして機能します。2つのインターフェースオプション、つまりGradioベースのバックエンドとモダンなReactベースのフロントエンドを提供します。システムは拡張可能なアーキテクチャをサポートしており、追加のモデルやツールは、内部のマーケットプレイスまたは外部のJSON設定を介して拡張機能(Pythonパッケージ)としてインストールできます。

対象者

各プロジェクトの個別インストールに煩わされることなく、さまざまな高品質な音声合成および音声生成モデルを試したいクリエイター、開発者、およびAI愛好家向けに設計されています。

ハイライト

  • 広範なモデルサポート: Bark、Tortoise、StyleTTS2、MusicGen、RVCを含む幅広いモデルを統合。
  • マルチモーダル音声ツール: 音声変換、音楽生成、音声分離(例:Demucs、Whisper)のためのツールを含む。
  • 柔軟なデプロイ: 専用のインストーラー(Ignition)、Dockerコンテナ、または手動セットアップによるインストールをサポート。
  • API統合: Silly TavernやOpenWebUIなどのサードパーティアプリケーションと統合するためのOpenAI互換APIを提供。
  • 拡張システム: コミュニティが作成した新しい音声機能を追加するための、組み込みのマーケットプレイスを搭載。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト