abus-aikorea/voice-pro

Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.

解決的問題

Voice-Pro 是一款旨在簡化複雜多語言內容創作工作流的一站式多媒體處理工具。它透過將 YouTube 下載、語音分離、語音識別、翻譯和文本轉語音 (TTS) 集成到單一介面中,消除了對多種獨立工具的需求。

工作原理

該應用程式作為一個基於 Web 的 UI(使用 Gradio 構建)運行,集成了多個最先進的 AI 模型:

  • 語音轉文本 (ASR): 使用 Whisper、Faster-Whisper 和 Whisper-Timestamped 進行高精度轉錄。
  • 聲音克隆與 TTS: 採用 F5-TTS、E2-TTS、CosyVoice、Edge-TTS 和 kokoro 進行零樣本聲音克隆和多語言語音生成。
  • 音訊處理: 集成了用於語音分離的 Demucs 和用於 YouTube 內容提取的 yt-dlp。
  • 翻譯: 使用 Deep-Translator 並可選使用 Azure Translator 來支持 100 多種語言。

適用對象

主要面向需要為影片配音、生成字幕或進行高品質音訊製作的播客主、內容創作者、研究人員和多語言專業人士。

亮點

  • 全面的配音工作室: 用於影片下載、降噪、翻譯和生成 TTS 的集中式中心。
  • 零樣本聲音克隆: 能夠使用 F5-TTS 和 CosyVoice 等模型在無需大量訓練的情況下克隆聲音。
  • 多語言支持: 支持 100 多種語言的轉錄和翻譯功能。
  • 集成字幕工具: 用於生成和顯示帶有逐字高亮字幕的專用選項卡。
  • 簡化安裝: 在配備 NVIDIA GPU 的 Windows 上使用 uv 安裝程式進行快速、可重複的設置。

相關

  • 專案
  • 專案
  • 專案
  • 專案