jianchang512/pyvideotrans
Translate the video from one language to another and embed dubbing & subtitles.
解決的問題
它實現了將影片從一種語言翻譯成另一種語言的複雜過程自動化。該工具提供了一個統一的工作流來處理語音識別、字幕翻譯和 AI 配音,同時保持音訊與影片同步,而無需手動進行轉錄、翻譯和重新錄製音訊。
工作原理
該專案實現了一個多階段流水線:
- 語音識別 (ASR):使用 Faster-Whisper 或各種雲端 API 等模型將語音音訊轉換為文本字幕。
- 字幕翻譯:使用 LLM(如 DeepSeek、ChatGPT 或本地 Ollama 模型)將文本翻譯成目標語言。
- 語音合成 (TTS):在目標語言中生成新的音訊,支援多角色分配與聲音克隆(透過 F5-TTS、CosyVoice 等)。
- 影片合成:將新音訊與翻譯後的字幕重新合併到原始影片中。
適用對象
專為內容創作者、開發人員以及任何需要高效實現影片內容在地化的人士設計,無論他們偏好簡單的 Windows 執行檔、用於伺服器的命令列介面,還是基於 Web 的 UI。
亮點
- 端到端自動化:從原始影片到翻譯配音影片的一鍵式工作流。
- 聲音克隆:整合先進的 TTS 模型以實現零樣本 (zero-shot) 聲音克隆。
- 說話人日誌 (Speaker Diarization):能夠區分不同的說話人,為每個角色分配獨特的 AI 聲音。
- 靈活部署:支援本地離線執行、雲端 API、Docker 以及預打包的 Windows
.exe。 - 互動式編輯:允許使用者在識別、翻譯和配音階段手動校對和編輯文本。
相關
- 專案
- 專案
- 專案
- 專案
- 專案