McCloudS/subgen

Autogenerate subtitles using OpenAI Whisper Model via Jellyfin, Plex, Emby, Tautulli, or Bazarr

解決的問題

Subgen 是一個自架設工具,可為個人媒體資料庫生成高準確度的字幕(.srt.lrc)。當官方字幕遺失、不同步或無法取得時,它允許使用者使用 AI 語音辨識,在自己的硬體上本地生成字幕。

運作方式

Subgen 使用 stable-tsfaster-whisper 來轉錄音訊/影片檔案。可將非英文語言轉錄為自身語言,或將外語音訊翻譯成英文。該工具支援 CPU 和 Nvidia GPU(CUDA)加速,並包含針對 Amazon WEB-DL 檔案中常見的音訊起始時間偏移的特殊修復,以確保時間戳完全對齊。

適用對象

專為使用 BazarrPlexEmbyJellyfinTautulli 等平台的家用媒體伺服器愛好者設計。可作為 Bazarr 的 Whisper 提供者整合,或透過媒體伺服器的 Webhook,於媒體新增或播放時自動觸發轉錄。

主要特色

  • 廣泛整合:與 Bazarr、Plex、Emby、Jellyfin 和 Tautulli 無縫連接。
  • 硬體加速:支援 CPU、Nvidia GPU(CUDA),以及可能的 AMD GPU(ROCm)。
  • 彈性模型選擇:支援多種 Whisper 模型,包括 large-v3-turbo(用於速度)和 distil-large-v3(用於效率)。
  • 自動偏移修正:使用 ffprobe 檢測並補償音訊串流的起始時間偏移,防止字幕過早出現。
  • 資料夾監控:可監控特定資料夾的變更,自動為新檔案生成字幕。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案