R3gm/SoniTranslate

Synchronized Translation for Videos. Video dubbing

解决的问题

SoniTranslate 简化了将视频翻译成不同语言并保持音频同步的过程。它提供了一个完整的处理流程,可在单一用户友好的网页界面中完成转录、翻译和语音生成(配音)。

工作原理

该应用程序使用基于 Gradio 的网页 UI 来协调多个 AI 模型和工具:

  • 转录:使用基于 Whisper 的模型(包括 faster-whisper 和 WhisperX)将语音转换为文本。
  • 翻译:使用 deep-translator 或 OpenAI 的 GPT API 等工具将转录的文本翻译为目标语言。
  • 语音生成:使用多种文本转语音(TTS)引擎(如 Piper、Coqui XTTS、BARK 和 Facebook-mms)生成翻译后的音频。还支持通过 OpenVoiceV2 和 RVC 模型实现语音模仿。
  • 处理:使用 FFmpeg 进行多媒体处理,使用 pyannote-audio 进行说话人分离(识别谁在说话)。

适用人群

内容创作者、教育工作者以及任何需要将视频内容本地化以面向全球受众,但无需手动协调多个独立的转录和配音工具的人。

主要亮点

  • 广泛的语言支持:支持大量语言的转录和翻译。
  • 语音克隆与模仿:集成 Coqui XTTS 和 OpenVoiceV2,支持逼真的语音克隆和模仿。
  • 灵活的输入/输出:支持 YouTube 播放列表、本地文件和 URL;输出可为视频、音频或字幕(包括 ASS 和软字幕)。
  • 可自定义的流程:允许用户选择偏好的 ASR 模型、TTS 引擎和翻译方法(包括 OpenAI API 集成)。
  • 可访问性:可通过本地安装或 Google Colab 笔记本使用。

相关

  • 项目
  • 项目
  • 项目
  • 项目