ahmetoner/whisper-asr-webservice

OpenAI Whisper ASR Webservice API

解决的问题

它为 OpenAI 的 Whisper 模型提供了一个开箱即用的 REST API 封装,使用户无需构建自己的服务器基础设施,即可轻松地将语音转文本功能部署并集成到其他应用程序中。

工作原理

该项目将多个高性能 Whisper 引擎(OpenAI Whisper、Faster Whisper 和 WhisperX)封装进 Dockerized Web 服务中。它使用 FFmpeg 处理多种音频和视频格式,并提供带有 Swagger 文档的 REST API,用于发送音频文件并接收转录文本。

适用对象

需要部署支持多种模型和输出格式(如用于字幕的 SRT 或 VTT)且可以在 CPU 或 GPU 上运行的自托管语音识别服务的开发人员。

亮点

  • 多引擎支持:支持 OpenAI Whisper、Faster Whisper 和 WhisperX。
  • 灵活的输出:转录结果可以导出为 text、JSON、VTT、SRT 或 TSV。
  • 高级转录:包括通过 WhisperX 实现的词级时间戳、语音活动检测 (VAD) 过滤和说话人日志 (diarization)。
  • 易于部署:提供适用于 CPU 和 GPU 加速的 Docker 镜像。
  • 广泛的格式支持:与 FFmpeg 集成,具有广泛的音频/视频兼容性。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目