QuentinFuxa/WhisperLiveKit

Real-time, local speech-to-text with streaming ASR, speaker diarization, translation, and OpenAI/Deepgram-compatible APIs.

何を解決するか

WhisperLiveKit (WLK) は、超低遅延で自己ホスト可能な音声認識(STT)パイプラインを提供します。標準的なWhisperは完全な発話を想定して設計されており、リアルタイムのチャンク処理には向いておらず、小さなセグメントで処理するとしばしば誤認識が発生し、文脈が失われる問題を解決します。

動作方法

WLKは最先端の同時音声認識研究を実装し、知的なバッファリングと段階的処理を可能にします。SimulStreamingおよびLocalAgreementポリシーを介したWhisper、Voxtral、FunASR/SenseVoiceSmall、Qwen3-ASR、NVIDIA Canary-1b-v2など、複数のバックエンドをサポートしています。システムは音声活動検出(VAD)を使用してオーバーヘッドを削減でき、OpenAI互換のREST API、Deepgram互換のWebSocket、またはネイティブWebSocketを介してリアルタイムストリーミング用のサーバーとしてデプロイ可能です。

対象ユーザー

リアルタイム音声認識サービスや、数百の言語間で同時翻訳を必要とするアプリケーションを開発する開発者、NVIDIA GPUやApple Siliconなどさまざまなハードウェア上で自己ホスト型で低遅延ASR(音声認識)を必要とするユーザー向けに設計されています。

特徴

  • 複数バックエンド対応: Whisper、Voxtral、Qwen3-ASR、NVIDIA Canaryを統合。
  • 超低遅延: AlignAttやLocalAgreementなどの高度なポリシーを活用し、リアルタイム出力を実現。
  • 広範な言語対応: NLLWを介して200言語への同時翻訳をサポート。
  • ハードウェア最適化: Apple Silicon(MLX)およびNVIDIA CUDA向けの特別な最適化。
  • 柔軟なAPI: OpenAI互換のRESTおよびWebSocketインターフェースを提供し、簡単に統合可能。
  • 高度な機能: Sortformerを介したリアルタイムスピーカー分離と因果的ストリーミング音声エンコーダーをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト