abus-aikorea/voice-pro
Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.
What it solves
Voice-Pro 是一款全能的多媒体处理工具,旨在简化创建多语言内容的复杂工作流。它消除了在不同工具之间切换的需求,涵盖下载视频、分离音频、语音转文字、文本翻译以及生成新配音等步骤。
How it works
该应用提供基于 Gradio 的网页界面,整合多种最先进的 AI 模型:
- Speech-to-Text (ASR): 使用 Whisper、Faster-Whisper 和 Whisper‑Timestamped 实现高精度转录和字幕生成。
- Text-to-Speech (TTS): 采用 Edge‑TTS、kokoro 以及 F5‑TTS、E2‑TTS、CosyVoice 等零样本克隆模型,生成自然语音或克隆特定声音。
- Translation: 集成 Deep‑Translator(可选 Azure Translator),支持超过 100 种语言。
- Audio Processing: 使用 Demucs 进行声音分离,使用 yt‑dlp 提取 YouTube 内容。
Who it’s for
此工具主要面向内容创作者、播客制作者、研究人员以及需要配音、字幕或语音克隆的多语言专业人士。
Highlights
- Complete Dubbing Pipeline: 集成 YouTube 下载、降噪、转录、翻译和 TTS,打造一站式工作室。
- Zero-Shot Voice Cloning: 能够使用 F5‑TTS、E2‑TTS 与 CosyVoice 在无需大量训练的情况下克隆声音。
- Multilingual Support: 支持超过 100 种语言的语音识别和翻译功能。
- Real-Time Capabilities: 支持即时语音识别和实时翻译。
- User‑Friendly Installation: 使用
uv在 Windows 上配合 NVIDIA GPU 实现快速、可复现的安装。