abus-aikorea/voice-pro

Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.

What it solves

Voice‑Pro는 다국어 콘텐츠 제작의 복잡한 워크플로우를 단순화하기 위해 설계된 올인원 멀티미디어 처리 도구입니다. 동영상 다운로드, 오디오 분리, 음성 텍스트 변환, 텍스트 번역, 새로운 보이스오버 생성 등 별도의 도구를 오가며 작업할 필요가 없습니다.

How it works

이 애플리케이션은 Gradio 기반 웹 인터페이스를 제공하며, 여러 최첨단 AI 모델을 통합합니다:

  • Speech-to-Text (ASR): Whisper, Faster‑Whisper, Whisper‑Timestamped 를 사용해 높은 정확도의 전사와 자막 생성을 수행합니다.
  • Text-to-Speech (TTS): Edge‑TTS, kokoro, 그리고 F5‑TTS, E2‑TTS, CosyVoice 와 같은 제로샷 클로닝 모델을 활용해 자연스러운 음성 또는 특정 목소리 클로닝을 생성합니다.
  • Translation: Deep‑Translator(옵션으로 Azure Translator) 를 통합해 100개 이상의 언어를 지원합니다.
  • Audio Processing: Demucs 로 음성 분리를 수행하고, yt‑dlp 로 YouTube 콘텐츠를 추출합니다.

Who it’s for

이 도구는 주로 동영상 더빙, 자막 제작, 음성 클론 팟캐스트 제작이 필요한 콘텐츠 제작자, 팟캐스터, 연구자 및 다국어 전문가를 대상으로 합니다.

Highlights

  • Complete Dubbing Pipeline: YouTube 다운로드, 노이즈 제거, 전사, 번역, TTS 를 하나의 스튜디오에서 통합합니다.
  • Zero-Shot Voice Cloning: 대규모 학습 없이 F5‑TTS, E2‑TTS, CosyVoice 로 음성을 클론할 수 있습니다.
  • Multilingual Support: 100개 이상의 언어에 대한 음성 인식 및 번역 기능을 제공합니다.
  • Real-Time Capabilities: 실시간 음성 인식 및 즉시 번역을 지원합니다.
  • User‑Friendly Installation: uv 를 사용해 Windows 환경에서 NVIDIA GPU 지원을 포함한 빠르고 재현 가능한 설치를 제공합니다.