jim60105/docker-whisperX
Dockerfile for WhisperX: Automatic Speech Recognition with Word-Level Timestamps and Speaker Diarization (Dockerfile, CI image build and test)
해결하는 문제
이 프로젝트는 단어 수준의 타임스탬프와 화자 분리 기능을 제공하는 자동 음성 인식(ASR) 시스템인 WhisperX용 최적화된 Docker 이미지 세트를 제공합니다. 이 프로젝트는 미리 다운로드된 모델을 함께 제공함으로써 WhisperX의 배포를 간소화하고, 사용자가 런타임 중에 의존성과 모델 다운로드를 수동으로 관리할 필요를 줄입니다.
작동 방식
이 프로젝트는 Dockerfile과 CI 워크플로우를 사용하여 대규모의 사전 빌드된 이미지를 구축하고 유지 관리합니다. 각 이미지는 모델 크기(예: large-v3)와 대상 언어(예: en은 영어, zh는 중국어)로 태그가 지정됩니다. 사용자는 GitHub Container Registry(GHCR)에서 사전 빌드된 이미지를 가져오거나, 특정 언어와 모델 조합을 위한 빌드 인수를 사용하여 자체적으로 빌드할 수 있습니다.
대상 사용자
Windows(WSL2를 통해), Linux, 또는 OSX에서 GPU 지원을 통해 WhisperX를 음성-텍스트 변환에 사용하고 싶은 사용자들을 위한 것입니다. 환경을 수동으로 설정하거나 기반 ASR 모델을 설치할 필요 없이 사용할 수 있습니다.
주요 특징
- 사전 빌드된 모델 번들: 배포를 빠르게 하기 위해 이미 모델이 내장된 다양한 이미지를 제공합니다.
- GPU 지원: 다양한 운영 체제에서 NVIDIA GPU를 위한 상세한 구성 가이드를 제공합니다.
- 최적화된 빌드 파이프라인: 주 170개 이상의 이미지를 효율적으로 빌드하기 위해 Docker 레이어 캐싱을 활용합니다.
- 특화된 모델:
distil-large-v3-en과 같은 희석된 버전 및breeze-asr-26-zh와 같은 지역 전용 모델(대만 훙커언어용)을 지원합니다. - 유연한 캐싱: 다른 컨테이너 간에 어라이먼트 모델을 공유할 수 있도록 로컬 볼륨을 마운트할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트