rsxdalv/TTS-WebUI

A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!

해결하는 문제

TTS WebUI는 방대한 양의 텍스트 음성 변환(TTS), 오디오 생성 및 오디오 변환 도구와 상호 작용할 수 있는 통합된 사용자 친화적 인터페이스를 제공합니다. 이를 통해 종종 의존성이 충돌하고 설정 프로세스가 복잡한 여러 개의 개별 AI 오디오 프로젝트를 설치하고 관리해야 하는 번거로움을 없애줍니다.

작동 방식

이 프로젝트는 수많은 오픈 소스 AI 오디오 모델을 위한 래퍼 및 관리자 역할을 합니다. 두 가지 인터페이스 옵션인 Gradio 기반 백엔드와 현대적인 React 기반 프론트엔드를 제공합니다. 시스템은 확장 가능한 아키텍처를 지원하며, 추가 모델 및 도구는 내부 마켓플레이스 또는 외부 JSON 구성을 통해 확장 기능(Python 패키지)으로 설치할 수 있습니다.

대상 사용자

각 개별 프로젝트를 수동으로 설치하는 번거로움 없이 다양한 고품질 음성 합성 및 오디오 생성 모델을 실험하고자 하는 크리에이터, 개발자 및 AI 애호가를 위해 설계되었습니다.

주요 특징

  • 광범위한 모델 지원: Bark, Tortoise, StyleTTS2, MusicGen, RVC를 포함한 다양한 모델 통합.
  • 멀티모달 오디오 도구: 오디오 변환, 음악 생성 및 오디오 분리(예: Demucs, Whisper)를 위한 도구 포함.
  • 유연한 배포: 전용 설치 프로그램(Ignition), Docker 컨테이너 또는 수동 설정을 통한 설치 지원.
  • API 통합: Silly Tavern 및 OpenWebUI와 같은 서드파티 애플리케이션과 통합할 수 있는 OpenAI 호환 API 제공.
  • 확장 시스템: 커뮤니티에서 제작한 새로운 오디오 기능을 추가하기 위한 내장 마켓플레이스 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트