rsxdalv/TTS-WebUI
A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!
What it solves
TTS WebUI 提供一个统一、用户友好的界面,用于运行各种文本转语音(TTS)、音频生成和音频转换工具。它消除了安装和管理多个独立 AI 音频项目的需求,将它们整合为一个同时支持 Gradio 和 React 前端的单一应用程序。
How it works
该项目充当众多开源 AI 音频模型的包装器和管理器。它支持包括 Bark、Tortoise、StyleTTS2、F5‑TTS 在内的大量模型,以及 MusicGen 等音频生成工具和 RVC、Whisper 等转换工具。系统通过插件架构具备可扩展性,用户可以直接在 UI 中通过 Python 包安装额外的模型和工具作为扩展。
Who it’s for
它面向创作者、开发者和 AI 爱好者,帮助他们在无需为每个项目手动安装的情况下,轻松使用多种高质量的 AI 语音和音频工具。
Highlights
- Comprehensive Model Support: 整合数十种 TTS、音乐生成和音频转换模型。
- Extensible Architecture: 提供扩展插件市场,可通过 Python 包添加新功能。
- Dual UI Options: 同时提供现代化的 React 前端和 Gradio 界面。
- Third-Party Integrations: 提供兼容 OpenAI 的 API,便于与 Silly Tavern、OpenWebUI 等工具集成。
- Flexible Deployment: 支持通过专用安装程序(Ignition)、Docker 或手动设置进行部署。