dimastatz/whisper-flow

Whisper-Flow is a framework designed to enable real-time transcription of audio content using OpenAI’s Whisper model. Rather than processing entire files after upload (“batch mode”), Whisper-Flow accepts a continuous stream of audio chunks and produces incremental transcripts immediately.

何を解決するか

Whisper Flow は、OpenAI の Whisper モデルをバッチ処理ツールからリアルタイム音声認識サービスに変換します。音声ファイル全体がアップロードされ、処理された後にのみトランスクリプトが得られるという問題を解決し、アプリケーション内で即時かつストリーミング音声認識機能を実現します。

動作方法

このプロジェクトは、順次パケットまたは「チャンク」として配信されるストリーミング音声データを処理するために「タブリングウィンドウ」技術を使用しています。音声ストリームを、沈黙や話者変更などの自然な発話パターンに基づいてセグメントに分割します。音声が処理されるにつれて、部分的なトランスクリプトイベントの連続が返され、最終的なセグメントが完了するまで更新されます。

対象ユーザー

Whisper モデルを使用してリアルタイムで低遅延の音声認識機能をソフトウェアに統合したい開発者、およびストリーミング音声セッションを管理するための Python ライブラリが必要なユーザー。

特徴

  • リアルタイムストリーミング: ファイルをバッチ処理するのではなく、音声チャンクを即座にテキストに変換します。
  • 低遅延: M1 Mac ハードウェア上で 500ms 未満の遅延を達成しています。
  • 柔軟なデプロイ: WebSockets を通じてスタンドアロンの FastAPI サーバとして実行可能、または Python ライブラリとして統合可能。
  • PCM 音声対応: 16 kHz、モノラル、16ビット符号付き整数音声データに特化しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト