ahmetoner/whisper-asr-webservice
OpenAI Whisper ASR Webservice API
解決的問題
它為 OpenAI 的 Whisper 模型提供了一個開箱即用的 REST API 封裝,使用戶無需構建自己的伺服器基礎設施,即可輕鬆地將語音轉文字功能部署並集成到其他應用程式中。
工作原理
該專案將多個高性能 Whisper 引擎(OpenAI Whisper、Faster Whisper 和 WhisperX)封裝進 Dockerized Web 服務中。它使用 FFmpeg 處理多種音訊與視訊格式,並提供帶有 Swagger 文件的 REST API,用於發送音訊檔案並接收轉錄文本。
適用對象
需要部署支援多種模型與輸出格式(如用於字幕的 SRT 或 VTT)且可以在 CPU 或 GPU 上運行的自託管語音識別服務的開發人員。
亮點
- 多引擎支援:支援 OpenAI Whisper、Faster Whisper 和 WhisperX。
- 靈活的輸出:轉錄結果可以匯出為 text、JSON、VTT、SRT 或 TSV。
- 進階轉錄:包含透過 WhisperX 實現的單字級時間戳、語音活動檢測 (VAD) 過濾以及說話者分離 (diarization)。
- 易於部署:提供適用於 CPU 與 GPU 加速的 Docker 鏡像。
- 廣泛的格式支援:與 FFmpeg 集成,具有廣泛的音訊/視訊相容性。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案