abus-aikorea/voice-pro
Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.
What it solves
Voice‑Pro は、マルチリンガルコンテンツ作成の複雑なワークフローをシンプルにするオールインワンのマルチメディア処理ツールです。動画のダウンロード、音声の分離、音声文字起こし、テキスト翻訳、そして新しいボイスオーバーの生成といった作業を別々のツールで行う必要がなくなります。
How it works
このアプリは Gradio ベースのウェブインターフェースを提供し、最先端の AI モデルを複数統合しています:
- Speech-to-Text (ASR): Whisper、Faster‑Whisper、Whisper‑Timestamped を使用し、高精度な文字起こしと字幕生成を実現。
- Text-to-Speech (TTS): Edge‑TTS、kokoro、そして F5‑TTS、E2‑TTS、CosyVoice といったゼロショットクローンモデルで自然な音声や特定の声のクローンを生成。
- Translation: Deep‑Translator(オプションで Azure Translator)を統合し、100 以上の言語に対応。
- Audio Processing: Demucs を使って音声分離を行い、yt‑dlp で YouTube コンテンツを抽出。
Who it’s for
このツールは主に、動画の吹き替えや字幕作成、音声クローンポッドキャストの制作が必要なコンテンツクリエイター、ポッドキャスター、研究者、マルチリンガルプロフェッショナル向けです。
Highlights
- Complete Dubbing Pipeline: YouTube ダウンロード、ノイズ除去、文字起こし、翻訳、TTS をすべて一つのスタジオで統合。
- Zero-Shot Voice Cloning: 大規模な学習なしで F5‑TTS、E2‑TTS、CosyVoice を用いた音声クローンが可能。
- Multilingual Support: 100 以上の言語に対応した音声認識と翻訳機能。
- Real-Time Capabilities: リアルタイムの音声認識とオンザフライ翻訳をサポート。
- User‑Friendly Installation:
uvを使用し、Windows 上で NVIDIA GPU 対応の高速で再現性のあるインストールを実現。