abus-aikorea/voice-pro
Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.
해결하는 문제
Voice-Pro는 다국어 콘텐츠 제작의 복잡한 워크플로우를 단순화하기 위해 설계된 올인원 멀티미디어 처리 도구입니다. YouTube 다운로드, 음성 분리, 음성 인식, 번역 및 텍스트 음성 변환(TTS)을 단일 인터페이스로 결합하여 여러 개의 개별 도구를 사용할 필요를 없앴습니다.
작동 방식
이 애플리케이션은 다음과 같은 최첨단 AI 모델을 통합한 웹 기반 UI(Gradio로 구축)로 작동합니다:
- Speech-to-Text (ASR): 고정밀 전사를 위해 Whisper, Faster-Whisper, Whisper-Timestamped를 사용합니다.
- Voice Cloning & TTS: 제로샷 보이스 클로닝 및 다국어 음성 생성을 위해 F5-TTS, E2-TTS, CosyVoice, Edge-TTS, kokoro를 채택했습니다.
- Audio Processing: 음성 분리를 위한 Demucs와 YouTube 콘텐츠 추출을 위한 yt-dlp를 통합했습니다.
- Translation: 100개 이상의 언어를 지원하기 위해 Deep-Translator와 옵션으로 Azure Translator를 사용합니다.
대상 사용자
주로 비디오 더빙, 자막 생성 또는 고품질 오디오 제작을 위한 보이스 클로닝이 필요한 팟캐스터, 콘텐츠 크리에이터, 연구자 및 다국어 전문가를 대상으로 합니다.
주요 특징
- 포괄적인 더빙 스튜디오: 비디오 다운로드, 노이즈 제거, 번역 및 TTS 생성을 위한 중앙 집중식 허브.
- 제로샷 보이스 클로닝: F5-TTS 및 CosyVoice와 같은 모델을 사용하여 광범위한 학습 없이 목소리를 클로닝하는 기능.
- 다국어 지원: 100개 이상의 언어에 대한 전사 및 번역 기능.
- 통합 자막 도구: 단어 단위 하이라이트 기능이 있는 자막 생성 및 표시를 위한 전용 탭.
- 간편한 설치: NVIDIA GPU가 있는 Windows에서 빠르고 재현 가능한 설정을 위해
uv설치 프로그램을 사용합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트