ahmetoner/whisper-asr-webservice

OpenAI Whisper ASR Webservice API

解決的問題

它為 OpenAI 的 Whisper 模型提供了一個開箱即用的 REST API 封裝,使用戶無需構建自己的伺服器基礎設施,即可輕鬆地將語音轉文字功能部署並集成到其他應用程式中。

工作原理

該專案將多個高性能 Whisper 引擎(OpenAI Whisper、Faster Whisper 和 WhisperX)封裝進 Dockerized Web 服務中。它使用 FFmpeg 處理多種音訊與視訊格式,並提供帶有 Swagger 文件的 REST API,用於發送音訊檔案並接收轉錄文本。

適用對象

需要部署支援多種模型與輸出格式(如用於字幕的 SRT 或 VTT)且可以在 CPU 或 GPU 上運行的自託管語音識別服務的開發人員。

亮點

  • 多引擎支援:支援 OpenAI Whisper、Faster Whisper 和 WhisperX。
  • 靈活的輸出:轉錄結果可以匯出為 text、JSON、VTT、SRT 或 TSV。
  • 進階轉錄:包含透過 WhisperX 實現的單字級時間戳、語音活動檢測 (VAD) 過濾以及說話者分離 (diarization)。
  • 易於部署:提供適用於 CPU 與 GPU 加速的 Docker 鏡像。
  • 廣泛的格式支援:與 FFmpeg 集成,具有廣泛的音訊/視訊相容性。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案