QuentinFuxa/WhisperLiveKit
Real-time, local speech-to-text with streaming ASR, speaker diarization, translation, and OpenAI/Deepgram-compatible APIs.
何を解決するか
WhisperLiveKit (WLK) は、超低遅延で自己ホスト可能な音声認識(STT)パイプラインを提供します。標準的なWhisperは完全な発話を想定して設計されており、リアルタイムのチャンク処理には向いておらず、小さなセグメントで処理するとしばしば誤認識が発生し、文脈が失われる問題を解決します。
動作方法
WLKは最先端の同時音声認識研究を実装し、知的なバッファリングと段階的処理を可能にします。SimulStreamingおよびLocalAgreementポリシーを介したWhisper、Voxtral、FunASR/SenseVoiceSmall、Qwen3-ASR、NVIDIA Canary-1b-v2など、複数のバックエンドをサポートしています。システムは音声活動検出(VAD)を使用してオーバーヘッドを削減でき、OpenAI互換のREST API、Deepgram互換のWebSocket、またはネイティブWebSocketを介してリアルタイムストリーミング用のサーバーとしてデプロイ可能です。
対象ユーザー
リアルタイム音声認識サービスや、数百の言語間で同時翻訳を必要とするアプリケーションを開発する開発者、NVIDIA GPUやApple Siliconなどさまざまなハードウェア上で自己ホスト型で低遅延ASR(音声認識)を必要とするユーザー向けに設計されています。
特徴
- 複数バックエンド対応: Whisper、Voxtral、Qwen3-ASR、NVIDIA Canaryを統合。
- 超低遅延: AlignAttやLocalAgreementなどの高度なポリシーを活用し、リアルタイム出力を実現。
- 広範な言語対応: NLLWを介して200言語への同時翻訳をサポート。
- ハードウェア最適化: Apple Silicon(MLX)およびNVIDIA CUDA向けの特別な最適化。
- 柔軟なAPI: OpenAI互換のRESTおよびWebSocketインターフェースを提供し、簡単に統合可能。
- 高度な機能: Sortformerを介したリアルタイムスピーカー分離と因果的ストリーミング音声エンコーダーをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト