bakrianoo/mazinger

End-to-end video dubbing pipeline

解决的问题

Mazinger Dubber 提供了一个端到端的自动化视频配音流水线。它消除了手动处理下载、转录、翻译和语音合成等独立工具的需要,用户只需一个命令或通过网页界面,即可生成完整的配音音频或视频文件。

工作原理

该系统串联了十个可恢复的阶段:下载、转录、缩略图、描述、审核、翻译、重分段、语音合成、组装和字幕。它会缓存每个阶段的输出,这意味着如果处理中断,可以从中断处恢复。该流水线集成了多个AI引擎:

  • 转录:使用 CohereX(Studio 默认)、Faster Whisper 或 Deepgram Nova 3。
  • 翻译:利用 LLM(包括通过 Ollama 提供的本地选项)。
  • 语音合成:采用语音克隆 TTS 引擎,如 Qwen3-TTS 和 OmniVoice。
  • 音频处理:使用 Demucs 进行背景音频分离。

适用人群

专为希望在保持原始说话人声音或使用预设语音主题的同时,将视频内容翻译成不同语言,且无需管理复杂独立 AI 工具链的内容创作者和开发者设计。

主要亮点

  • 自动语音克隆:可从源视频中自动提取 20–60 秒的样本,克隆原始说话人的声音。
  • 灵活的转录:支持本地转录(CohereX、Faster Whisper)和云服务选项(Deepgram)。
  • 全面的输出:可生成带有嵌入式、样式化字幕的配音视频,包括阿拉伯语等 RTL 语言的支持。
  • Web UI:包含“Mazinger Studio”,一个基于 Gradio 的界面,供不习惯命令行的用户使用。
  • 模块化执行:配音流程的每个阶段均可作为独立命令运行,或作为完整流水线的一部分运行。

相关

  • 项目
  • 项目
  • 项目
  • 项目