bakrianoo/mazinger
End-to-end video dubbing pipeline
解决的问题
Mazinger Dubber 提供了一个端到端的自动化视频配音流水线。它消除了手动处理下载、转录、翻译和语音合成等独立工具的需要,用户只需一个命令或通过网页界面,即可生成完整的配音音频或视频文件。
工作原理
该系统串联了十个可恢复的阶段:下载、转录、缩略图、描述、审核、翻译、重分段、语音合成、组装和字幕。它会缓存每个阶段的输出,这意味着如果处理中断,可以从中断处恢复。该流水线集成了多个AI引擎:
- 转录:使用 CohereX(Studio 默认)、Faster Whisper 或 Deepgram Nova 3。
- 翻译:利用 LLM(包括通过 Ollama 提供的本地选项)。
- 语音合成:采用语音克隆 TTS 引擎,如 Qwen3-TTS 和 OmniVoice。
- 音频处理:使用 Demucs 进行背景音频分离。
适用人群
专为希望在保持原始说话人声音或使用预设语音主题的同时,将视频内容翻译成不同语言,且无需管理复杂独立 AI 工具链的内容创作者和开发者设计。
主要亮点
- 自动语音克隆:可从源视频中自动提取 20–60 秒的样本,克隆原始说话人的声音。
- 灵活的转录:支持本地转录(CohereX、Faster Whisper)和云服务选项(Deepgram)。
- 全面的输出:可生成带有嵌入式、样式化字幕的配音视频,包括阿拉伯语等 RTL 语言的支持。
- Web UI:包含“Mazinger Studio”,一个基于 Gradio 的界面,供不习惯命令行的用户使用。
- 模块化执行:配音流程的每个阶段均可作为独立命令运行,或作为完整流水线的一部分运行。
相关
- 项目
- 项目
- 项目
- 项目