rsxdalv/TTS-WebUI
A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!
解决的问题
TTS WebUI 为与大量文本转语音 (TTS)、音频生成和音频转换工具进行交互提供了一个统一且用户友好的界面。它消除了安装和管理多个独立的 AI 音频项目的需求,这些项目通常具有冲突的依赖关系和复杂的设置过程。
工作原理
该项目充当众多开源 AI 音频模型的封装器和管理器。它提供两种界面选项:基于 Gradio 的后端和基于 React 的现代前端。该系统支持可扩展的架构,可以通过内部市场或外部 JSON 配置将额外的模型和工具作为扩展(Python 包)进行安装。
适用对象
专为想要尝试各种高质量语音合成和音频生成模型,而又不想处理每个单独项目的手动安装的创作者、开发人员和 AI 爱好者设计。
亮点
- 广泛的模型支持:集成了包括 Bark、Tortoise、StyleTTS2、MusicGen 和 RVC 在内的广泛模型。
- 多模态音频工具:包括音频转换、音乐生成和音频分离(例如 Demucs、Whisper)的工具。
- 灵活的部署:支持通过专用安装程序 (Ignition)、Docker 容器或手动设置进行安装。
- API 集成:提供与 OpenAI 兼容的 API,以便与 Silly Tavern 和 OpenWebUI 等第三方应用程序集成。
- 扩展系统:具有内置的市场,用于添加新的社区创建的音频功能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目