QuentinFuxa/WhisperLiveKit
Simultaneous speech-to-text models
What it solves
WhisperLiveKit 提供了一个超低延迟、自托管的语音转文字 (STT) 流水线。它解决了使用 Whisper 模型进行实时转录的问题,因为标准的 Whisper 是为完整语料设计的,在处理小型、实时的音频片段时,往往会产生不良的结果或切断单词。
How it works
该项目实施了最先进的同步语音研究,包括 AlignAtt SimulStreaming 和 LocalAgreement 策略,以处理智能缓冲和增量处理。它支持多种后端,包括 Faster-Whisper、MLX (针对 Apple Silicon)、Voxtral Mini 和 Qwen3-ASR。为了降低开销,它集成了 Voice Activity Detection (VAD) 以忽略静音。该系统可以部署为具有 OpenAI 兼容的 REST APIs、Deepgram 兼容的 WebSockets 或用于流式传输的原生 WebSocket 服务器。
Who it’s for
它专为构建实时转录服务、应用程序旨在实现跨 200 种语言的同步翻译,或需要自托管、低延迟 ASR (Automatic Speech Recognition) 且具备说话人日志 (speaker diarization) 功能的人员设计的。
Highlights
- Ultra-low latency: 使用先进的流式传输策略来提供实时转录。
- Multiple Backends: 支持多种模型,包括 Whisper, Voxtral Mini (4B parameters), 和 Qwen3-ASR。
- Broad API Compatibility: OpenAI 和 Deepgram APIs 的即插即用替代方案。
- Multilingual Translation: 通过 NLLW 实现 200 种语言之间的同步翻译。
- Speaker Diarization: 使用 Sortformer 或 Diart 进行实时说话人识别。
- Hardware Optimized: 支持 NVIDIA GPUs (CUDA) 和 Apple Silicon (MLX/Metal)。