abus-aikorea/voice-pro

Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.

What it solves

Voice‑Pro は、マルチリンガルコンテンツ作成の複雑なワークフローをシンプルにするオールインワンのマルチメディア処理ツールです。動画のダウンロード、音声の分離、音声文字起こし、テキスト翻訳、そして新しいボイスオーバーの生成といった作業を別々のツールで行う必要がなくなります。

How it works

このアプリは Gradio ベースのウェブインターフェースを提供し、最先端の AI モデルを複数統合しています:

  • Speech-to-Text (ASR): Whisper、Faster‑Whisper、Whisper‑Timestamped を使用し、高精度な文字起こしと字幕生成を実現。
  • Text-to-Speech (TTS): Edge‑TTS、kokoro、そして F5‑TTS、E2‑TTS、CosyVoice といったゼロショットクローンモデルで自然な音声や特定の声のクローンを生成。
  • Translation: Deep‑Translator(オプションで Azure Translator)を統合し、100 以上の言語に対応。
  • Audio Processing: Demucs を使って音声分離を行い、yt‑dlp で YouTube コンテンツを抽出。

Who it’s for

このツールは主に、動画の吹き替えや字幕作成、音声クローンポッドキャストの制作が必要なコンテンツクリエイター、ポッドキャスター、研究者、マルチリンガルプロフェッショナル向けです。

Highlights

  • Complete Dubbing Pipeline: YouTube ダウンロード、ノイズ除去、文字起こし、翻訳、TTS をすべて一つのスタジオで統合。
  • Zero-Shot Voice Cloning: 大規模な学習なしで F5‑TTS、E2‑TTS、CosyVoice を用いた音声クローンが可能。
  • Multilingual Support: 100 以上の言語に対応した音声認識と翻訳機能。
  • Real-Time Capabilities: リアルタイムの音声認識とオンザフライ翻訳をサポート。
  • User‑Friendly Installation: uv を使用し、Windows 上で NVIDIA GPU 対応の高速で再現性のあるインストールを実現。