schibsted/WAAS
Whisper as a Service (GUI and API with queuing for OpenAI Whisper)
解決する課題
WAASは、OpenAI Whisperをオーディオおよびビデオの文字起こしにデプロイして使用するためのユーザーフレンドリーな方法を提供します。グラフィカルユーザーインターフェース (GUI)、REST API、および非同期ジョブキューを追加することで、生のWhisperモデルを完全なサービスへと変貌させ、コマンドラインや複雑なスクリプトを介してモデルを操作する必要性を排除します。
仕組み
このシステムは、リクエストを処理するFlaskベースのAPI、文字起こしタスクを管理するRedisバックエンドのジョブキュー (RQを使用)、およびWhisperを使用してオーディオファイルを処理するワーカーの3つの主要コンポーネントで構成されています。ユーザーはGUI (Jojoと呼ばれる) またはAPIを介してファイルを送信し、言語やモデルサイズなどのパラメータを指定できます。処理が完了すると、システムは電子メールまたはwebhookを通じてユーザーに通知し、さまざまな形式 (SRT、VTT、JSON、またはプレーンテキスト) で結果のダウンロードリンクを提供します。
対象ユーザー
オーディオやビデオファイルを大規模に文字起こしする必要がある方、または基盤となる機械学習インフラを個別に管理することなく、他のアプリケーションに文字起こし機能を統合したい方向けに設計されています。
ハイライト
- 統合エディタ: ブラウザベースのエディタ (Jojo) を含んでおり、オーディオセグメントを聴きながらローカルで文字起こしの誤りを修正できます。
- 非同期処理: キューシステムを使用して、APIをブロックすることなく複数の文字起こしジョブを処理します。
- 複数の出力形式: 文字起こし結果をSRT、VTT、JSON、プレーンテキストとしてエクスポートすることをサポートしています。
- 柔軟な通知: 電子メールコールバックまたは安全なwebhookを通じて、ジョブの完了をユーザーに通知します。
- GPUアクセラレーション: Dockerを介したNVIDIA CUDAをサポートしており、より高速な文字起こしが可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト