rsxdalv/TTS-WebUI
A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!
What it solves
TTS WebUI 提供一個統一、使用者友善的介面,讓您能執行各式各樣的文字轉語音(TTS)、音訊生成與音訊轉換工具。它消除了安裝與管理多個獨立 AI 音訊專案的需求,將它們整合成一個同時支援 Gradio 與 React 前端的單一應用程式。
How it works
此專案充當眾多開源 AI 音訊模型的包裝器與管理器。它支援包括 Bark、Tortoise、StyleTTS2、F5‑TTS 在內的廣大模型,以及 MusicGen 等音訊生成工具與 RVC、Whisper 等轉換工具。系統透過插件架構具備可擴充性,使用者可直接在 UI 中安裝額外模型與工具(Python 套件)作為擴充功能。
Who it’s for
此工具設計給創作者、開發者與 AI 愛好者使用,讓他們能在不必為每個專案手動安裝的情況下,輕鬆取得多種高品質的 AI 語音與音訊工具。
Highlights
- Comprehensive Model Support: 整合數十種 TTS、音樂生成與音訊轉換模型。
- Extensible Architecture: 具備擴充套件市集,可透過 Python 套件新增功能。
- Dual UI Options: 同時提供現代化的 React 前端與 Gradio 介面。
- Third-Party Integrations: 提供相容 OpenAI 的 API,方便與 Silly Tavern、OpenWebUI 等工具整合。
- Flexible Deployment: 支援透過專屬安裝程式(Ignition)、Docker 或手動設定方式安裝。