abus-aikorea/voice-pro
Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.
解決する課題
Voice-Proは、多言語コンテンツ制作の複雑なワークフローを簡素化するために設計されたオールインワンのマルチメディア処理ツールです。YouTubeのダウンロード、音声分離、音声認識、翻訳、およびテキスト読み上げ(TTS)を単一のインターフェースに統合することで、複数のツールを使い分ける必要性を排除します。
仕組み
本アプリケーションは、以下の最先端AIモデルを統合したWebベースのUI(Gradioで構築)として動作します:
- Speech-to-Text (ASR): 高精度な文字起こしに Whisper、Faster-Whisper、Whisper-Timestamped を使用。
- Voice Cloning & TTS: ゼロショットのボイスクローニングと多言語音声生成に F5-TTS、E2-TTS、CosyVoice、Edge-TTS、kokoro を採用。
- Audio Processing: 音声分離に Demucs、YouTubeコンテンツ抽出に yt-dlp を統合。
- Translation: 100以上の言語をサポートするため、Deep-Translator およびオプションで Azure Translator を使用。
対象者
主に、ビデオの吹き替え、字幕生成、または高品質なオーディオ制作のためのボイスクローニングを必要とするポッドキャスター、コンテンツクリエイター、研究者、および多言語専門家を対象としています。
ハイライト
- 包括的な吹き替えスタジオ: ビデオのダウンロード、ノイズ除去、翻訳、およびTTS生成のための集中ハブ。
- ゼロショット・ボイスクローニング: F5-TTS や CosyVoice などのモデルを使用し、広範なトレーニングなしで音声をクローン化する機能。
- 多言語サポート: 100以上の言語に対する文字起こしおよび翻訳機能。
- 統合字幕ツール: 単語レベルのハイライト付き字幕を生成・表示するための専用タブ。
- 簡素化されたインストール: NVIDIA GPUを搭載したWindows環境において、高速で再現可能なセットアップを実現する
uvインストーラーを使用。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト