abus-aikorea/voice-pro

Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.

What it solves

Voice-Pro 是一款全能的多媒体处理工具,旨在简化创建多语言内容的复杂工作流。它消除了在不同工具之间切换的需求,涵盖下载视频、分离音频、语音转文字、文本翻译以及生成新配音等步骤。

How it works

该应用提供基于 Gradio 的网页界面,整合多种最先进的 AI 模型:

  • Speech-to-Text (ASR): 使用 Whisper、Faster-Whisper 和 Whisper‑Timestamped 实现高精度转录和字幕生成。
  • Text-to-Speech (TTS): 采用 Edge‑TTS、kokoro 以及 F5‑TTS、E2‑TTS、CosyVoice 等零样本克隆模型,生成自然语音或克隆特定声音。
  • Translation: 集成 Deep‑Translator(可选 Azure Translator),支持超过 100 种语言。
  • Audio Processing: 使用 Demucs 进行声音分离,使用 yt‑dlp 提取 YouTube 内容。

Who it’s for

此工具主要面向内容创作者、播客制作者、研究人员以及需要配音、字幕或语音克隆的多语言专业人士。

Highlights

  • Complete Dubbing Pipeline: 集成 YouTube 下载、降噪、转录、翻译和 TTS,打造一站式工作室。
  • Zero-Shot Voice Cloning: 能够使用 F5‑TTS、E2‑TTS 与 CosyVoice 在无需大量训练的情况下克隆声音。
  • Multilingual Support: 支持超过 100 种语言的语音识别和翻译功能。
  • Real-Time Capabilities: 支持即时语音识别和实时翻译。
  • User‑Friendly Installation: 使用 uv 在 Windows 上配合 NVIDIA GPU 实现快速、可复现的安装。