McCloudS/subgen
Autogenerate subtitles using OpenAI Whisper Model via Jellyfin, Plex, Emby, Tautulli, or Bazarr
何を解決するか
Subgen は、個人用メディアライブラリ用の高精度の字幕(.srt または .lrc)を生成する自己ホスト型ツールです。公式字幕が存在しない、同期がずれている、または利用できない場合に、AIによる音声認識を使って、自宅のハードウェア上でローカルに字幕を作成できるようにします。
動作方法
Subgen は stable-ts と faster-whisper を使用して、音声/動画ファイルを音声認識します。非英語の音声をそのまま翻訳するか、外国語の音声を英語に翻訳できます。CPU と Nvidia GPU(CUDA)の両方をサポートしており、Amazon WEB-DL ファイルに一般的に見られる音声の開始時刻オフセットに対応する特別な修正も含まれており、タイムスタンプが正確に一致するようにします。
対象ユーザー
Bazarr、Plex、Emby、Jellyfin、または Tautulli を使用するホームメディアサーバー愛好家向けに設計されています。Bazarr の Whisper プロバイダーとして統合されるか、メディアサーバーからの Webhook を通じて、メディアが追加または再生されたときに自動的に音声認識をトリガーします。
特徴
- 広範な統合: Bazarr、Plex、Emby、Jellyfin、Tautulli とスムーズに連携。
- ハードウェア加速: CPU、Nvidia GPU(CUDA)、AMD GPU 用の ROCm(可能性あり)をサポート。
- 柔軟なモデル選択:
large-v3-turbo(高速)やdistil-large-v3(効率的)を含むさまざまな Whisper モデルに対応。 - 自動オフセット補正:
ffprobeを使って音声ストリームの開始時刻オフセットを検出し、早期の字幕表示を防ぎます。 - フォルダ監視: 特定のフォルダの変更を監視し、新規ファイルに対して自動的に字幕を生成します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト