abus-aikorea/voice-pro
Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.
What it solves
Voice-Pro 是一款全方位的多媒體處理工具,旨在簡化製作多語言內容的複雜流程。它消除在不同工具之間切換的需求,涵蓋下載影片、分離音訊、語音轉文字、文字翻譯以及產生新配音等步驟。
How it works
此應用程式提供基於 Gradio 的網頁介面,整合多個最先進的 AI 模型:
- Speech-to-Text (ASR): 使用 Whisper、Faster-Whisper 與 Whisper‑Timestamped 進行高精度轉錄與字幕產生。
- Text-to-Speech (TTS): 採用 Edge‑TTS、kokoro 以及 F5‑TTS、E2‑TTS、CosyVoice 等零樣本克隆模型,產生自然語音或克隆特定聲音。
- Translation: 整合 Deep‑Translator(可選 Azure Translator),支援超過 100 種語言。
- Audio Processing: 使用 Demucs 進行聲音分離,並以 yt‑dlp 抽取 YouTube 內容。
Who it’s for
此工具主要針對內容創作者、播客製作人、研究人員與需要多語言配音、字幕或語音克隆的專業人士。
Highlights
- Complete Dubbing Pipeline: 整合 YouTube 下載、降噪、轉錄、翻譯與 TTS,打造一站式工作室。
- Zero-Shot Voice Cloning: 可使用 F5‑TTS、E2‑TTS 與 CosyVoice 在無需大量訓練的情況下克隆聲音。
- Multilingual Support: 支援超過 100 種語言的語音辨識與翻譯功能。
- Real-Time Capabilities: 提供即時語音辨識與即時翻譯。
- User‑Friendly Installation: 使用
uv於 Windows 搭配 NVIDIA GPU 進行快速、可重現的安裝。