jianchang512/pyvideotrans

Translate the video from one language to another and embed dubbing & subtitles.

解決的問題

它實現了將影片從一種語言翻譯成另一種語言的複雜過程自動化。該工具提供了一個統一的工作流來處理語音識別、字幕翻譯和 AI 配音,同時保持音訊與影片同步,而無需手動進行轉錄、翻譯和重新錄製音訊。

工作原理

該專案實現了一個多階段流水線:

  1. 語音識別 (ASR):使用 Faster-Whisper 或各種雲端 API 等模型將語音音訊轉換為文本字幕。
  2. 字幕翻譯:使用 LLM(如 DeepSeek、ChatGPT 或本地 Ollama 模型)將文本翻譯成目標語言。
  3. 語音合成 (TTS):在目標語言中生成新的音訊,支援多角色分配與聲音克隆(透過 F5-TTS、CosyVoice 等)。
  4. 影片合成:將新音訊與翻譯後的字幕重新合併到原始影片中。

適用對象

專為內容創作者、開發人員以及任何需要高效實現影片內容在地化的人士設計,無論他們偏好簡單的 Windows 執行檔、用於伺服器的命令列介面,還是基於 Web 的 UI。

亮點

  • 端到端自動化:從原始影片到翻譯配音影片的一鍵式工作流。
  • 聲音克隆:整合先進的 TTS 模型以實現零樣本 (zero-shot) 聲音克隆。
  • 說話人日誌 (Speaker Diarization):能夠區分不同的說話人,為每個角色分配獨特的 AI 聲音。
  • 靈活部署:支援本地離線執行、雲端 API、Docker 以及預打包的 Windows .exe
  • 互動式編輯:允許使用者在識別、翻譯和配音階段手動校對和編輯文本。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案