rsxdalv/TTS-WebUI

A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!

What it solves

TTS WebUI 提供一个统一、用户友好的界面,用于运行各种文本转语音(TTS)、音频生成和音频转换工具。它消除了安装和管理多个独立 AI 音频项目的需求,将它们整合为一个同时支持 Gradio 和 React 前端的单一应用程序。

How it works

该项目充当众多开源 AI 音频模型的包装器和管理器。它支持包括 Bark、Tortoise、StyleTTS2、F5‑TTS 在内的大量模型,以及 MusicGen 等音频生成工具和 RVC、Whisper 等转换工具。系统通过插件架构具备可扩展性,用户可以直接在 UI 中通过 Python 包安装额外的模型和工具作为扩展。

Who it’s for

它面向创作者、开发者和 AI 爱好者,帮助他们在无需为每个项目手动安装的情况下,轻松使用多种高质量的 AI 语音和音频工具。

Highlights

  • Comprehensive Model Support: 整合数十种 TTS、音乐生成和音频转换模型。
  • Extensible Architecture: 提供扩展插件市场,可通过 Python 包添加新功能。
  • Dual UI Options: 同时提供现代化的 React 前端和 Gradio 界面。
  • Third-Party Integrations: 提供兼容 OpenAI 的 API,便于与 Silly Tavern、OpenWebUI 等工具集成。
  • Flexible Deployment: 支持通过专用安装程序(Ignition)、Docker 或手动设置进行部署。