McCloudS/subgen
Autogenerate subtitles using OpenAI Whisper Model via Jellyfin, Plex, Emby, Tautulli, or Bazarr
解决的问题
Subgen 是一个自托管工具,可为个人媒体库生成高精度字幕(.srt 或 .lrc)。当官方字幕缺失、不同步或不可用时,它允许用户使用 AI 语音识别,在自己的硬件上本地生成字幕。
工作原理
Subgen 使用 stable-ts 和 faster-whisper 来转录音视频文件。它可以将非英语语言转录为自身语言,或翻译外语音频为英文。该工具支持 CPU 和 Nvidia GPU(CUDA)加速,并包含针对 Amazon WEB-DL 文件中常见的音频起始时间偏移的特殊修复,以确保时间戳完全对齐。
适用人群
专为使用 Bazarr、Plex、Emby、Jellyfin 或 Tautulli 等平台的家用媒体服务器爱好者设计。它可作为 Bazarr 的 Whisper 提供者集成,或通过媒体服务器的 Webhook 自动触发转录,当媒体被添加或播放时。
主要亮点
- 广泛集成:与 Bazarr、Plex、Emby、Jellyfin 和 Tautulli 无缝连接。
- 硬件加速:支持 CPU、Nvidia GPU(CUDA),以及可能的 AMD GPU(ROCm)。
- 灵活的模型选择:支持多种 Whisper 模型,包括
large-v3-turbo(用于速度)和distil-large-v3(用于效率)。 - 自动偏移校正:使用
ffprobe检测并补偿音频流的起始时间偏移,防止字幕过早出现。 - 文件夹监控:可监控特定文件夹的变更,自动为新文件生成字幕。
相关
- 项目
- 项目
- 项目
- 项目
- 项目