R3gm/SoniTranslate
Synchronized Translation for Videos. Video dubbing
解决的问题
SoniTranslate 简化了将视频翻译成不同语言并保持音频同步的过程。它提供了一个完整的处理流程,可在单一用户友好的网页界面中完成转录、翻译和语音生成(配音)。
工作原理
该应用程序使用基于 Gradio 的网页 UI 来协调多个 AI 模型和工具:
- 转录:使用基于 Whisper 的模型(包括 faster-whisper 和 WhisperX)将语音转换为文本。
- 翻译:使用 deep-translator 或 OpenAI 的 GPT API 等工具将转录的文本翻译为目标语言。
- 语音生成:使用多种文本转语音(TTS)引擎(如 Piper、Coqui XTTS、BARK 和 Facebook-mms)生成翻译后的音频。还支持通过 OpenVoiceV2 和 RVC 模型实现语音模仿。
- 处理:使用 FFmpeg 进行多媒体处理,使用 pyannote-audio 进行说话人分离(识别谁在说话)。
适用人群
内容创作者、教育工作者以及任何需要将视频内容本地化以面向全球受众,但无需手动协调多个独立的转录和配音工具的人。
主要亮点
- 广泛的语言支持:支持大量语言的转录和翻译。
- 语音克隆与模仿:集成 Coqui XTTS 和 OpenVoiceV2,支持逼真的语音克隆和模仿。
- 灵活的输入/输出:支持 YouTube 播放列表、本地文件和 URL;输出可为视频、音频或字幕(包括 ASS 和软字幕)。
- 可自定义的流程:允许用户选择偏好的 ASR 模型、TTS 引擎和翻译方法(包括 OpenAI API 集成)。
- 可访问性:可通过本地安装或 Google Colab 笔记本使用。
相关
- 项目
- 项目
- 项目
- 项目