ahmetoner/whisper-asr-webservice

OpenAI Whisper ASR Webservice API

解決する課題

OpenAIのWhisperモデル用の即時利用可能なREST APIラッパーを提供します。これにより、ユーザーは独自のサーバーインフラを構築することなく、音声からテキストへの変換機能を他のアプリケーションに簡単にデプロイおよび統合できます。

仕組み

このプロジェクトは、複数の高性能なWhisperエンジン(OpenAI Whisper、Faster Whisper、WhisperX)をDocker化されたウェブサービスとしてラップします。FFmpegを使用して幅広いオーディオおよびビデオ形式を処理し、音声ファイルの送信と文字起こしの受信を行うためのSwaggerドキュメント付きREST APIを提供します。

対象者

複数のモデルや出力形式(字幕用のSRTやVTTなど)をサポートし、CPUまたはGPUのいずれかで実行可能な、セルフホスト型の音声認識サービスをデプロイする必要がある開発者。

ハイライト

  • 複数のエンジンをサポート: OpenAI Whisper、Faster Whisper、WhisperXをサポート。
  • 柔軟な出力: 文字起こし結果は、text、JSON、VTT、SRT、またはTSVとしてエクスポート可能です。
  • 高度な文字起こし: WhisperXによる単語レベルのタイムスタンプ、音声活動検出(VAD)フィルタリング、および話者分離を含みます。
  • 容易なデプロイ: CPUおよびGPUアクセラレーションの両方に対応したDockerイメージとして提供。
  • 幅広いフォーマット対応: FFmpegとの統合により、広範なオーディオ/ビデオ互換性を実現。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト