rsxdalv/TTS-WebUI

A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!

What it solves

TTS WebUI는 텍스트‑투‑스피치(TTS), 오디오 생성 및 오디오 변환 도구를 폭넓게 실행할 수 있는 통합되고 사용자 친화적인 인터페이스를 제공합니다. 여러 개별 AI 오디오 프로젝트를 설치·관리할 필요 없이 Gradio와 React 기반 UI를 모두 갖춘 하나의 애플리케이션으로 통합합니다.

How it works

이 프로젝트는 수많은 오픈소스 AI 오디오 모델의 래퍼이자 관리자로 동작합니다. Bark, Tortoise, StyleTTS2, F5‑TTS 등 다양한 모델은 물론 MusicGen 같은 오디오 생성 도구와 RVC, Whisper 같은 변환 도구도 지원합니다. 플러그인 아키텍처를 통해 확장성을 제공하며, 추가 모델 및 도구를 UI에서 직접 Python 패키지 형태로 설치할 수 있습니다.

Who it’s for

각 프로젝트를 수동으로 설치할 필요 없이 여러 고품질 AI 음성·오디오 도구에 접근하고자 하는 크리에이터, 개발자, AI 애호가를 위해 설계되었습니다.

Highlights

  • Comprehensive Model Support: 수십 개의 TTS, 음악 생성 및 오디오 변환 모델을 통합.
  • Extensible Architecture: Python 패키지를 통해 새로운 기능을 추가할 수 있는 확장 마켓플레이스를 제공.
  • Dual UI Options: 최신 React 기반 프론트엔드와 Gradio 기반 인터페이스를 모두 제공.
  • Third-Party Integrations: OpenAI 호환 API를 제공하여 Silly Tavern, OpenWebUI 등과 연동 가능.
  • Flexible Deployment: 전용 설치 프로그램(Ignition), Docker 또는 수동 설정을 통한 설치를 지원.