abus-aikorea/voice-pro
Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.
解决的问题
Voice-Pro 是一款旨在简化复杂多语言内容创作工作流的一站式多媒体处理工具。它通过将 YouTube 下载、语音分离、语音识别、翻译和文本转语音 (TTS) 集成到单个界面中,消除了对多种独立工具的需求。
工作原理
该应用程序作为一个基于 Web 的 UI(使用 Gradio 构建)运行,集成了多个最先进的 AI 模型:
- 语音转文本 (ASR): 使用 Whisper、Faster-Whisper 和 Whisper-Timestamped 进行高精度转录。
- 声音克隆与 TTS: 采用 F5-TTS、E2-TTS、CosyVoice、Edge-TTS 和 kokoro 进行零样本声音克隆和多语言语音生成。
- 音频处理: 集成了用于语音分离的 Demucs 和用于 YouTube 内容提取的 yt-dlp。
- 翻译: 使用 Deep-Translator 并可选使用 Azure Translator 来支持 100 多种语言。
适用对象
主要面向需要为视频配音、生成字幕或进行高质量音频制作的播客主、内容创作者、研究人员和多语言专业人士。
亮点
- 全面的配音工作室: 用于视频下载、降噪、翻译和生成 TTS 的集中式中心。
- 零样本声音克隆: 能够使用 F5-TTS 和 CosyVoice 等模型在无需大量训练的情况下克隆声音。
- 多语言支持: 支持 100 多种语言的转录和翻译功能。
- 集成字幕工具: 用于生成和显示带有逐词高亮字幕的专用选项卡。
- 简化安装: 在配备 NVIDIA GPU 的 Windows 上使用
uv安装程序进行快速、可重复的设置。
相关
- 项目
- 项目
- 项目
- 项目