jianchang512/pyvideotrans
Translate the video from one language to another and embed dubbing & subtitles.
解决的问题
它实现了将视频从一种语言翻译成另一种语言的复杂过程自动化。该工具提供了一个统一的工作流来处理语音识别、字幕翻译和 AI 配音,同时保持音频和视频同步,而无需手动进行转录、翻译和重新录制音频。
工作原理
该项目实现了一个多阶段流水线:
- 语音识别 (ASR):使用 Faster-Whisper 或各种云端 API 等模型将语音音频转换为文本字幕。
- 字幕翻译:使用 LLM(如 DeepSeek、ChatGPT 或本地 Ollama 模型)将文本翻译成目标语言。
- 语音合成 (TTS):在目标语言中生成新的音频,支持多角色分配和声音克隆(通过 F5-TTS、CosyVoice 等)。
- 视频合成:将新音频和翻译后的字幕重新合并到原始视频中。
适用对象
专为内容创作者、开发人员以及任何需要高效实现视频内容本地化的人士设计,无论他们偏好简单的 Windows 可执行文件、用于服务器的命令行界面,还是基于 Web 的 UI。
亮点
- 端到端自动化:从原始视频到翻译配音视频的一键式工作流。
- 声音克隆:集成先进的 TTS 模型以实现零样本 (zero-shot) 声音克隆。
- 说话人日志 (Speaker Diarization):能够区分不同的说话人,为每个角色分配独特的 AI 声音。
- 灵活部署:支持本地离线运行、云端 API、Docker 以及预打包的 Windows
.exe。 - 交互式编辑:允许用户在识别、翻译和配音阶段手动校对和编辑文本。
相关
- 项目
- 项目
- 项目
- 项目
- 项目