jianchang512/pyvideotrans

Translate the video from one language to another and embed dubbing & subtitles.

解决的问题

它实现了将视频从一种语言翻译成另一种语言的复杂过程自动化。该工具提供了一个统一的工作流来处理语音识别、字幕翻译和 AI 配音,同时保持音频和视频同步,而无需手动进行转录、翻译和重新录制音频。

工作原理

该项目实现了一个多阶段流水线:

  1. 语音识别 (ASR):使用 Faster-Whisper 或各种云端 API 等模型将语音音频转换为文本字幕。
  2. 字幕翻译:使用 LLM(如 DeepSeek、ChatGPT 或本地 Ollama 模型)将文本翻译成目标语言。
  3. 语音合成 (TTS):在目标语言中生成新的音频,支持多角色分配和声音克隆(通过 F5-TTS、CosyVoice 等)。
  4. 视频合成:将新音频和翻译后的字幕重新合并到原始视频中。

适用对象

专为内容创作者、开发人员以及任何需要高效实现视频内容本地化的人士设计,无论他们偏好简单的 Windows 可执行文件、用于服务器的命令行界面,还是基于 Web 的 UI。

亮点

  • 端到端自动化:从原始视频到翻译配音视频的一键式工作流。
  • 声音克隆:集成先进的 TTS 模型以实现零样本 (zero-shot) 声音克隆。
  • 说话人日志 (Speaker Diarization):能够区分不同的说话人,为每个角色分配独特的 AI 声音。
  • 灵活部署:支持本地离线运行、云端 API、Docker 以及预打包的 Windows .exe
  • 交互式编辑:允许用户在识别、翻译和配音阶段手动校对和编辑文本。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目