rsxdalv/TTS-WebUI
A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!
What it solves
TTS WebUI は、テキスト読み上げ(TTS)、音声生成、音声変換ツールを幅広く実行できる、統一されたユーザーフレンドリーなインターフェースを提供します。複数の個別 AI 音声プロジェクトをインストール・管理する必要がなく、Gradio と React の両方の UI を備えた単一アプリケーションに統合します。
How it works
本プロジェクトは多数のオープンソース AI 音声モデルのラッパー兼マネージャーとして機能します。Bark、Tortoise、StyleTTS2、F5‑TTS などのモデルに加え、MusicGen などの音声生成ツールや RVC、Whisper といった変換ツールもサポートします。プラグインアーキテクチャにより拡張性があり、追加のモデルやツールを UI から直接 Python パッケージとしてインストールできます。
Who it’s for
個別プロジェクトを手動でインストールする手間なく、複数の高品質 AI 音声・音声ツールにアクセスしたいクリエイター、開発者、AI 愛好家向けに設計されています。
Highlights
- Comprehensive Model Support: 数十種の TTS、音楽生成、音声変換モデルを統合。
- Extensible Architecture: Python パッケージで新機能を追加できる拡張マーケットプレイスを搭載。
- Dual UI Options: モダンな React ベースのフロントエンドと Gradio ベースのインターフェースの両方を提供。
- Third-Party Integrations: OpenAI 互換 API を提供し、Silly Tavern や OpenWebUI などのツールと統合可能。
- Flexible Deployment: 専用インストーラ(Ignition)、Docker、手動セットアップのいずれかでインストール可能。