rsxdalv/TTS-WebUI

A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!

解決的問題

TTS WebUI 為與大量文本轉語音 (TTS)、音訊生成和音訊轉換工具進行互動提供了一個統一且使用者友好的介面。它消除了安裝和管理多個獨立 AI 音訊專案的需求,這些專案通常具有衝突的依賴關係和複雜的設定流程。

工作原理

該專案充當眾多開源 AI 音訊模型的封裝器與管理器。它提供兩種介面選項:基於 Gradio 的後端和基於 React 的現代前端。該系統支援可擴展的架構,可以透過內部市場或外部 JSON 配置將額外的模型和工具作為擴充功能 (Python 套件) 進行安裝。

適用對象

專為想要嘗試各種高品質語音合成和音訊生成模型,而又不想處理每個單獨專案的手動安裝的創作者、開發人員和 AI 愛好家設計。

亮點

  • 廣泛的模型支援:整合了包括 Bark、Tortoise、StyleTTS2、MusicGen 和 RVC 在內的廣泛模型。
  • 多模態音訊工具:包括音訊轉換、音樂生成和音訊分離(例如 Demucs、Whisper)的工具。
  • 靈活的部署:支援透過專用安裝程式 (Ignition)、Docker 容器或手動設定進行安裝。
  • API 整合:提供與 OpenAI 相容的 API,以便與 Silly Tavern 和 OpenWebUI 等第三方應用程式整合。
  • 擴充系統:具有內建的市場,用於添加新的社群建立的音訊功能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案