jim60105/docker-whisperX

Dockerfile for WhisperX: Automatic Speech Recognition with Word-Level Timestamps and Speaker Diarization (Dockerfile, CI image build and test)

解决的问题

本项目提供一组为 WhisperX 优化的 Docker 镜像,WhisperX 是一种自动语音识别(ASR)系统,可提供单词级时间戳和说话人分离功能。该项目通过捆绑预先下载的模型,简化了 WhisperX 的部署,减少了用户在运行时手动管理依赖项和模型下载的需求。

工作原理

该项目使用 Dockerfile 和 CI 工作流来构建和维护大量预构建镜像。每个镜像均按模型大小(例如 large-v3)和目标语言(例如 en 表示英语,zh 表示中文)进行标记。用户可以从 GitHub Container Registry (GHCR) 拉取预构建镜像,或使用构建参数自行构建特定语言和模型组合的镜像。

适用人群

适用于希望在 Windows(通过 WSL2)、Linux 或 macOS 上使用 GPU 支持运行 WhisperX 进行语音转文字转录的用户,无需手动配置环境或安装底层 ASR 模型。

主要亮点

  • 预构建模型包:提供多种镜像,模型已预先内置,可加速部署。
  • GPU 支持:提供针对不同操作系统上 NVIDIA GPU 的详细配置指南。
  • 优化的构建流水线:利用高效的 Docker 层缓存,每周管理超过 170 个镜像的构建。
  • 专用模型:支持蒸馏变体(如 distil-large-v3-en)和特定区域模型(如 breeze-asr-26-zh,用于台湾话)。
  • 灵活的缓存机制:支持挂载本地卷,实现不同容器间对齐模型的共享。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目