jim60105/docker-whisperX

Dockerfile for WhisperX: Automatic Speech Recognition with Word-Level Timestamps and Speaker Diarization (Dockerfile, CI image build and test)

何を解決するか

このプロジェクトは、WhisperX(自動音声認識(ASR)システム)用の最適化されたDockerイメージのコレクションを提供します。WhisperXは単語レベルのタイムスタンプと話者分離を提供します。このプロジェクトは、事前にダウンロードされたモデルをバンドルすることで、WhisperXのデプロイを簡素化し、実行時にユーザーが依存関係やモデルのダウンロードを手動で管理する必要を減らします。

動作方法

このプロジェクトはDockerfileとCIワークフローを使用して、多数の事前ビルド済みイメージを構築および維持しています。各イメージはモデルサイズ(例:large-v3)とターゲット言語(例:en は英語、zh は中国語)でタグ付けされています。ユーザーはGitHub Container Registry(GHCR)から事前ビルド済みイメージを取得するか、特定の言語とモデルの組み合わせ用にビルド引数を使用して独自にビルドできます。

対象ユーザー

Windows(WSL2経由)、Linux、またはOSXでGPUサポート付きでWhisperXを実行したいユーザー向けです。環境の手動設定や基盤となるASRモデルのインストールをせずに利用できます。

特徴

  • 事前ビルド済みモデルバンドル:デプロイを高速化するため、モデルが事前に組み込まれた幅広いイメージを提供します。
  • GPUサポート:NVIDIA GPUの異なるオペレーティングシステム向けの詳細な設定ガイドを提供します。
  • 最適化されたビルドパイプライン:170以上のイメージを週に1回以上効率的にビルドするためのDockerレイヤーキャッシュを活用しています。
  • 専用モデルdistil-large-v3-enのような蒸留バージョンや、台湾語(Hokkien)向けの専用モデルbreeze-asr-26-zhをサポートしています。
  • 柔軟なキャッシュ:異なるコンテナ間でアライメントモデルを共有できるように、ローカルボリュームをマウントできます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト