QuentinFuxa/WhisperLiveKit

Simultaneous speech-to-text models

What it solves

WhisperLiveKit 提供了一個超低延遲、自託管的語音轉文字 (STT) 管線。它解決了使用 Whisper 模型進行即時轉錄的問題,因為標準的 Whisper 是為完整的語句設計的,在處理小型、即時的音訊區塊時,往往會產生不良的結果或切斷單詞。

How it works

該專案實作了尖端的同步語音研究,包括 AlignAtt SimulStreaming 與 LocalAgreement 策略,以處理智慧型緩衝與增量處理。它支援多種後端,包括 Faster-Whisper、MLX (針對 Apple Silicon)、Voxtral Mini 與 Qwen3-ASR。為了降低開銷,它整合了 Voice Activity Detection (VAD) 以忽略靜音。該系統可以部署為具有 OpenAI 相容性 REST API、Deepgram 相容性 WebSockets 或用於串流的原生 WebSocket 的伺服器。

Who it’s for

它專為開發即時轉錄服務、需要跨 200 種語言進行同步翻譯的應用程式,或需要具備說話者分割 (speaker diarization) 功能且低延遲的自託管 ASR (Automatic Speech Recognition) 的開發者而設計。

Highlights

  • Ultra-low latency: 使用先進的串流策略來提供即時轉錄。
  • Multiple Backends: 支援多種模型,包括 Whisper、Voxtral Mini (4B parameters) 與 Qwen3-ASR。
  • Broad API Compatibility: OpenAI 與 Deepgram API 的即插即用替代方案。
  • Multilingual Translation: 透過 NLLW 進行 200 種語言之間的同步翻譯。
  • Speaker Diarization: 使用 Sortformer 或 Diart 進行即時說話者識別。
  • Hardware Optimized: 針對 NVIDIA GPUs (CUDA) 與 Apple Silicon (MLX/Metal) 提供專用支援。