QuentinFuxa/WhisperLiveKit
Real-time, local speech-to-text with streaming ASR, speaker diarization, translation, and OpenAI/Deepgram-compatible APIs.
解决的问题
WhisperLiveKit (WLK) 提供超低延迟、自托管的语音转文本(STT)管道。它解决了使用 Whisper 等模型进行实时转录的问题,因为标准 Whisper 是为完整语句设计的,而非实时分块处理,这在小段处理时常常导致转录质量差和上下文丢失。
工作原理
WLK 实现了最先进的同步语音研究,以实现智能缓冲和增量处理。支持多种后端,包括通过 SimulStreaming 和 LocalAgreement 策略的 Whisper、Voxtral、FunASR/SenseVoiceSmall、Qwen3-ASR 和 NVIDIA Canary-1b-v2。系统使用语音活动检测(VAD)来减少开销,可作为服务器部署,支持 OpenAI 兼容的 REST API、Deepgram 兼容的 WebSocket 或原生 WebSocket 以实现实时流式传输。
适用人群
专为开发实时转录服务的开发者、需要跨数百种语言进行实时翻译的应用程序,或需要在各种硬件(包括 NVIDIA GPU 和 Apple Silicon)上自托管、低延迟 ASR(自动语音识别)的用户设计。
主要亮点
- 多后端支持:集成 Whisper、Voxtral、Qwen3-ASR 和 NVIDIA Canary。
- 超低延迟:使用 AlignAtt 和 LocalAgreement 等高级策略实现实时输出。
- 广泛的语言支持:通过 NLLW 支持 200 种语言的实时翻译。
- 硬件优化:针对 Apple Silicon(MLX)和 NVIDIA CUDA 进行了特定优化。
- 灵活的 API:提供 OpenAI 兼容的 REST 和 WebSocket 接口,便于集成。
- 高级功能:支持实时说话人分离(通过 Sortformer)和因果流式音频编码器。
相关
- 项目
- 项目
- 项目
- 项目
- 项目