voice-pro: 專為 YouTube 處理、聲音複製與多語言翻譯打造的一站式 AI 配音工作室
它解決了什麼問題
Voice-Pro 是一款一站式多媒體處理工具,旨在簡化建立多語言內容的複雜工作流程。它消除了在下載影片、分離音訊、語音轉文字、翻譯文本以及生成新配音之間切換不同工具的需求。
運作原理
該應用程式提供了一個基於 Gradio 的網頁介面,整合了多種尖端的 AI 模型:
- Speech-to-Text (ASR): 使用 Whisper、Faster-Whisper 和 Whisper-Timestamped 進行高精度的逐字稿生成與字幕製作。
- Text-to-Speech (TTS): 採用 Edge-TTS、kokoro 以及如 F5-TTS、E2-TTS 和 CosyVoice 等 zero-shot 複製模型來生成自然聽感的語音或複製特定聲音。
- Translation: 整合了 Deep-Translator(以及可選的 Azure Translator)以支援超過 100 種語言。
- Audio Processing: 使用 Demucs 進行人聲分離,並使用 yt-dlp 進行 YouTube 內容擷取。
對象是誰
此工具主要針對內容創作者、播客製作人、研究人員以及需要為影片配音、製作字幕或製作聲音複製播客的多語言專業人士。
重點特色
- 完整的配音流程: 在一個工作室中整合了 YouTube 下載、降噪、逐字稿生成、翻譯與 TTS。
- Zero-Shot 聲音複製: 能夠使用 F5-TTS、E2-TTS 和 CosyVoice 在無需大量訓練的情況下複製聲音。
- 多語言支援: 具備超過 100 種語言的語音辨識與翻譯能力。
- 即時處理能力: 支援即時語音辨識與即時翻譯。
- 使用者友善的安裝方式: 在支援 NVIDIA GPU 的 Windows 環境下,使用
uv進行快速且可重複的安裝。