bakrianoo/mazinger

End-to-end video dubbing pipeline

解決的問題

Mazinger Dubber 提供了一個端到端的自動化影片配音流程。它消除了手動處理下載、轉錄、翻譯和語音合成等獨立工具的需求,使用者只需一個指令或透過網頁介面,即可從單一命令產生完整的配音音訊或影片檔案。

運作方式

此系統串聯了十個可恢復的階段:下載、轉錄、縮圖、描述、審核、翻譯、重分段、語音合成、組裝與字幕。它會快取每個階段的輸出,因此若處理中斷,可從中斷處恢復。該流程整合了多個 AI 引擎:

  • 轉錄:使用 CohereX(Studio 預設)、Faster Whisper 或 Deepgram Nova 3。
  • 翻譯:利用 LLM(包括透過 Ollama 提供的本地選項)。
  • 語音合成:採用語音克隆 TTS 引擎,如 Qwen3-TTS 和 OmniVoice。
  • 音訊處理:使用 Demucs 進行背景音訊分離。

適用對象

專為希望在保留原始講者聲音或使用預設語音主題的同時,將影片內容翻譯成不同語言,且無需管理複雜獨立 AI 工具鏈的內容創作者與開發者設計。

主要特色

  • 自動語音克隆:可從原始影片中自動提取 20–60 秒的樣本,克隆原始講者的聲音。
  • 彈性轉錄:支援本地轉錄(CohereX、Faster Whisper)與雲端選項(Deepgram)。
  • 全面輸出:可產生帶有內嵌、樣式化字幕的配音影片,包含阿拉伯語等 RTL 語言支援。
  • Web UI:內建「Mazinger Studio」,一個基於 Gradio 的介面,供不習慣命令列的使用者使用。
  • 模組化執行:配音流程的每個階段可獨立執行為命令,或作為完整流程的一部分執行。

相關

  • 專案
  • 專案
  • 專案
  • 專案