rsxdalv/TTS-WebUI

A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!

What it solves

TTS WebUI は、テキスト読み上げ(TTS)、音声生成、音声変換ツールを幅広く実行できる、統一されたユーザーフレンドリーなインターフェースを提供します。複数の個別 AI 音声プロジェクトをインストール・管理する必要がなく、Gradio と React の両方の UI を備えた単一アプリケーションに統合します。

How it works

本プロジェクトは多数のオープンソース AI 音声モデルのラッパー兼マネージャーとして機能します。Bark、Tortoise、StyleTTS2、F5‑TTS などのモデルに加え、MusicGen などの音声生成ツールや RVC、Whisper といった変換ツールもサポートします。プラグインアーキテクチャにより拡張性があり、追加のモデルやツールを UI から直接 Python パッケージとしてインストールできます。

Who it’s for

個別プロジェクトを手動でインストールする手間なく、複数の高品質 AI 音声・音声ツールにアクセスしたいクリエイター、開発者、AI 愛好家向けに設計されています。

Highlights

  • Comprehensive Model Support: 数十種の TTS、音楽生成、音声変換モデルを統合。
  • Extensible Architecture: Python パッケージで新機能を追加できる拡張マーケットプレイスを搭載。
  • Dual UI Options: モダンな React ベースのフロントエンドと Gradio ベースのインターフェースの両方を提供。
  • Third-Party Integrations: OpenAI 互換 API を提供し、Silly Tavern や OpenWebUI などのツールと統合可能。
  • Flexible Deployment: 専用インストーラ(Ignition)、Docker、手動セットアップのいずれかでインストール可能。