abus-aikorea/voice-pro

Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.

What it solves

Voice-Pro 是一款全方位的多媒體處理工具,旨在簡化製作多語言內容的複雜流程。它消除在不同工具之間切換的需求,涵蓋下載影片、分離音訊、語音轉文字、文字翻譯以及產生新配音等步驟。

How it works

此應用程式提供基於 Gradio 的網頁介面,整合多個最先進的 AI 模型:

  • Speech-to-Text (ASR): 使用 Whisper、Faster-Whisper 與 Whisper‑Timestamped 進行高精度轉錄與字幕產生。
  • Text-to-Speech (TTS): 採用 Edge‑TTS、kokoro 以及 F5‑TTS、E2‑TTS、CosyVoice 等零樣本克隆模型,產生自然語音或克隆特定聲音。
  • Translation: 整合 Deep‑Translator(可選 Azure Translator),支援超過 100 種語言。
  • Audio Processing: 使用 Demucs 進行聲音分離,並以 yt‑dlp 抽取 YouTube 內容。

Who it’s for

此工具主要針對內容創作者、播客製作人、研究人員與需要多語言配音、字幕或語音克隆的專業人士。

Highlights

  • Complete Dubbing Pipeline: 整合 YouTube 下載、降噪、轉錄、翻譯與 TTS,打造一站式工作室。
  • Zero-Shot Voice Cloning: 可使用 F5‑TTS、E2‑TTS 與 CosyVoice 在無需大量訓練的情況下克隆聲音。
  • Multilingual Support: 支援超過 100 種語言的語音辨識與翻譯功能。
  • Real-Time Capabilities: 提供即時語音辨識與即時翻譯。
  • User‑Friendly Installation: 使用 uv 於 Windows 搭配 NVIDIA GPU 進行快速、可重現的安裝。