R3gm/SoniTranslate

Synchronized Translation for Videos. Video dubbing

解決的問題

SoniTranslate 簡化了將影片翻譯成不同語言並保持音訊同步的流程。它提供了一個完整的處理流程,可在單一使用者友善的網頁介面中完成轉錄、翻譯與語音生成(配音)。

工作原理

該應用程式使用基於 Gradio 的網頁 UI 來協調多個 AI 模型與工具:

  • 轉錄:使用基於 Whisper 的模型(包括 faster-whisper 和 WhisperX)將語音轉換為文字。
  • 翻譯:使用 deep-translator 或 OpenAI 的 GPT API 等工具將轉錄的文字翻譯成目標語言。
  • 語音生成:使用多種文字轉語音(TTS)引擎(如 Piper、Coqui XTTS、BARK 和 Facebook-mms)生成翻譯後的音訊。也支援透過 OpenVoiceV2 和 RVC 模型進行語音模仿。
  • 處理:使用 FFmpeg 進行多媒體處理,使用 pyannote-audio 進行說話人分離(識別誰在說話)。

適用對象

內容創作者、教育工作者,以及任何需要將影片內容本地化以面向全球觀眾,但無需手動協調多個獨立的轉錄與配音工具的人。

主要亮點

  • 廣泛的語言支援:支援大量語言的轉錄與翻譯。
  • 語音克隆與模仿:整合 Coqui XTTS 和 OpenVoiceV2,支援逼真的語音克隆與模仿。
  • 彈性的輸入/輸出:支援 YouTube 播放列表、本機檔案與 URL;輸出可為影片、音訊或字幕(包含 ASS 與軟字幕)。
  • 可自訂的流程:允許使用者選擇偏好的 ASR 模型、TTS 引擎與翻譯方式(包含 OpenAI API 集成)。
  • 可存取性:可透過本機安裝或 Google Colab 筆記本使用。

相關

  • 專案
  • 專案
  • 專案
  • 專案