QuentinFuxa/WhisperLiveKit
Simultaneous speech-to-text models
What it solves
WhisperLiveKit 提供了一個超低延遲、自託管的語音轉文字 (STT) 管線。它解決了使用 Whisper 模型進行即時轉錄的問題,因為標準的 Whisper 是為完整的語句設計的,在處理小型、即時的音訊區塊時,往往會產生不良的結果或切斷單詞。
How it works
該專案實作了尖端的同步語音研究,包括 AlignAtt SimulStreaming 與 LocalAgreement 策略,以處理智慧型緩衝與增量處理。它支援多種後端,包括 Faster-Whisper、MLX (針對 Apple Silicon)、Voxtral Mini 與 Qwen3-ASR。為了降低開銷,它整合了 Voice Activity Detection (VAD) 以忽略靜音。該系統可以部署為具有 OpenAI 相容性 REST API、Deepgram 相容性 WebSockets 或用於串流的原生 WebSocket 的伺服器。
Who it’s for
它專為開發即時轉錄服務、需要跨 200 種語言進行同步翻譯的應用程式,或需要具備說話者分割 (speaker diarization) 功能且低延遲的自託管 ASR (Automatic Speech Recognition) 的開發者而設計。
Highlights
- Ultra-low latency: 使用先進的串流策略來提供即時轉錄。
- Multiple Backends: 支援多種模型,包括 Whisper、Voxtral Mini (4B parameters) 與 Qwen3-ASR。
- Broad API Compatibility: OpenAI 與 Deepgram API 的即插即用替代方案。
- Multilingual Translation: 透過 NLLW 進行 200 種語言之間的同步翻譯。
- Speaker Diarization: 使用 Sortformer 或 Diart 進行即時說話者識別。
- Hardware Optimized: 針對 NVIDIA GPUs (CUDA) 與 Apple Silicon (MLX/Metal) 提供專用支援。