jim60105/docker-whisperX

Dockerfile for WhisperX: Automatic Speech Recognition with Word-Level Timestamps and Speaker Diarization (Dockerfile, CI image build and test)

解決的問題

本專案提供一組為 WhisperX 優化的 Docker 映像,WhisperX 是一種自動語音辨識(ASR)系統,可提供詞彙級時間戳與說話人分離功能。此專案透過內建預先下載的模型,簡化 WhisperX 的部署,減少使用者在執行時手動管理相依性與模型下載的需求。

運作方式

本專案使用 Dockerfile 與 CI 工作流程來建構與維護大量預先建置的映像。每個映像皆以模型大小(例如 large-v3)與目標語言(例如 en 表示英文,zh 表示中文)進行標籤。使用者可從 GitHub Container Registry (GHCR) 拉取預先建置的映像,或使用建構參數自行建構特定語言與模型組合的映像。

適用對象

適用於希望在 Windows(透過 WSL2)、Linux 或 macOS 上使用 GPU 支援運行 WhisperX 進行語音轉文字轉錄的使用者,無需手動設定環境或安裝底層 ASR 模型。

主要特色

  • 預建置模型套件:提供多種映像,模型已內建,可加速部署。
  • GPU 支援:提供針對不同作業系統上 NVIDIA GPU 的詳細設定指南。
  • 優化的建構流程:利用高效的 Docker 層快取,每周管理超過 170 個映像的建構。
  • 專用模型:支援蒸餾變體(如 distil-large-v3-en)與特定區域模型(如 breeze-asr-26-zh,用於台灣話)。
  • 彈性快取機制:支援掛載本機卷,實現不同容器間對齊模型的共享。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案