ahmetoner/whisper-asr-webservice
OpenAI Whisper ASR Webservice API
解決する課題
OpenAIのWhisperモデル用の即時利用可能なREST APIラッパーを提供します。これにより、ユーザーは独自のサーバーインフラを構築することなく、音声からテキストへの変換機能を他のアプリケーションに簡単にデプロイおよび統合できます。
仕組み
このプロジェクトは、複数の高性能なWhisperエンジン(OpenAI Whisper、Faster Whisper、WhisperX)をDocker化されたウェブサービスとしてラップします。FFmpegを使用して幅広いオーディオおよびビデオ形式を処理し、音声ファイルの送信と文字起こしの受信を行うためのSwaggerドキュメント付きREST APIを提供します。
対象者
複数のモデルや出力形式(字幕用のSRTやVTTなど)をサポートし、CPUまたはGPUのいずれかで実行可能な、セルフホスト型の音声認識サービスをデプロイする必要がある開発者。
ハイライト
- 複数のエンジンをサポート: OpenAI Whisper、Faster Whisper、WhisperXをサポート。
- 柔軟な出力: 文字起こし結果は、text、JSON、VTT、SRT、またはTSVとしてエクスポート可能です。
- 高度な文字起こし: WhisperXによる単語レベルのタイムスタンプ、音声活動検出(VAD)フィルタリング、および話者分離を含みます。
- 容易なデプロイ: CPUおよびGPUアクセラレーションの両方に対応したDockerイメージとして提供。
- 幅広いフォーマット対応: FFmpegとの統合により、広範なオーディオ/ビデオ互換性を実現。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト