lenML/Speech-AI-Forge
🍦 Speech-AI-Forge is a project developed around TTS generation model, implementing an API Server and a Gradio-based WebUI.
해결하는 문제
Speech-AI-Forge는 다양한 최첨단 텍스트 음성 변환(TTS) 및 자동 음성 인식(ASR) 모델을 위한 통합 인터페이스와 배포 프레임워크를 제공합니다. 이를 통해 서로 다른 음성 AI 모델을 위해 여러 개의 개별 리포지토리를 설치하고 관리할 필요 없이, 음성 생성, 클로닝 및 전사를 위한 중앙 허브를 제공합니다.
작동 방식
이 프로젝트는 여러 음성 모델을 래핑하는 API 서버와 Gradio 기반의 WebUI를 구현합니다. ChatTTS, CosyVoice, FishSpeech, GPT-SoVITS, F5-TTS, Qwen3-TTS를 포함한 광범위한 모델뿐만 아니라 Whisper 및 SenseVoice와 같은 ASR 모델도 지원합니다. 사용자는 Windows 독립형 패키지, Google Colab, Docker 또는 로컬 설치를 통해 배포할 수 있습니다.
대상 사용자
여러 개별 모델 환경을 관리하는 복잡함 없이 고품질 AI 음성 합성 및 전사 서비스가 필요한 개발자와 크리에이터를 위해 설계되었습니다.
주요 특징
- 멀티 모델 지원: 수많은 TTS 엔진(예: ChatTTS, CosyVoice, F5-TTS) 및 ASR 엔진(Whisper, SenseVoice) 통합.
- 고급 음성 제어: 화자 전환, 사용자 정의 음성 업로드, 참조 기반 클로닝 및 스타일 제어 기능 제공.
- SSML 지원: 긴 텍스트 합성, 팟캐스트 스타일의 멀티 역할 오디오 및 자막-음성 변환 생성을 위한 세밀한 제어 도구 포함.
- 음성 관리: 사용자 정의 음성 생성, 혼합 및 테스트를 위한 도구(전용 음성 리소스 허브 포함).
- 포괄적인 툴링: 음성 강화(ResembleEnhance) 및 오디오 클리핑 및 조정을 위한 후처리 도구 포함.
- 유연한 배포: 대화형 사용을 위한 전체 WebUI와 고처리량 애플리케이션을 위한 독립형 API 서버를 모두 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트