McCloudS/subgen
Autogenerate subtitles using OpenAI Whisper Model via Jellyfin, Plex, Emby, Tautulli, or Bazarr
해결하는 문제
Subgen은 개인 미디어 라이브러리용 고정확도 자막(.srt 또는 .lrc)을 생성하는 자체 호스팅 도구입니다. 공식 자막이 없거나, 동기화가 맞지 않거나, 사용할 수 없는 경우, AI 음성 인식을 사용하여 사용자의 자체 하드웨어에서 로컬로 자막을 생성할 수 있게 해줍니다.
작동 방식
Subgen은 stable-ts와 faster-whisper를 사용하여 오디오/비디오 파일을 음성 인식합니다. 비영어 언어를 그 언어 자체로 또는 외국어 오디오를 영어로 번역할 수 있습니다. CPU와 Nvidia GPU(CUDA) 가속을 모두 지원하며, Amazon WEB-DL 파일에서 흔히 발생하는 오디오 시작 시간 오프셋을 특별히 수정하여 타임스탬프가 완벽하게 일치하도록 합니다.
대상 사용자
Bazarr, Plex, Emby, Jellyfin, 또는 Tautulli를 사용하는 홈 미디어 서버 애호가를 위한 것입니다. Bazarr의 Whisper 제공자로 통합되거나, 미디어 서버에서 웹훅을 통해 미디어가 추가되거나 재생될 때 자동으로 음성 인식을 트리거합니다.
주요 기능
- 광범위한 통합: Bazarr, Plex, Emby, Jellyfin, Tautulli와 원활하게 연결됩니다.
- 하드웨어 가속: CPU, Nvidia GPU(CUDA), AMD GPU용 ROCm(가능성 있음)을 지원합니다.
- 유연한 모델 선택:
large-v3-turbo(속도용) 및distil-large-v3(효율성용)를 포함한 다양한 Whisper 모델을 지원합니다. - 자동 오프셋 보정:
ffprobe를 사용해 오디오 스트림의 시작 시간 오프셋을 감지하고 보정하여 조기 자막을 방지합니다. - 폴더 모니터링: 특정 폴더의 변경 사항을 감시하여 새 파일에 대해 자동으로 자막을 생성합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트