QuentinFuxa/WhisperLiveKit
Simultaneous speech-to-text models
What it solves
WhisperLiveKit은 초저지연, 셀프 호스팅 방식의 음성-텍스트 변환 (STT) 파이프라인을 제공합니다. 표준 Whisper 모델은 전체 발화 내용을 처리하도록 설계되어 있어, 실시간으로 작은 오디오 청크를 처리할 때 결과가 좋지 않거나 단어가 잘리는 문제가 있습니다. WhisperLiveKit은 이 문제를 해결합니다.
How it works
이 프로젝트는 지능적인 버퍼링과 증분 처리를 처리하기 위해 AlignAtt SimulStreaming 및 LocalAgreement 정책을 포함한 최첨단 동시 음성 연구를 구현합니다. Faster-Whisper, MLX (Apple Silicon용), Voxtral Mini, Qwen3-ASR 등 다양한 백엔드를 지원합니다. 오버헤드를 줄이기 위해 Voice Activity Detection (VAD)를 통합하여 무음 구간을 무시합니다. 시스템은 OpenAI 호환 REST API, Deepgram 호환 WebSocket, 또는 스트리밍을 위한 네이티브 WebSocket 서버로 배포할 수 있습니다.
Who it’s for
실시간 전사 서비스를 구축하는 개발자, 200개 언어로 동시 번역이 필요한 애플리케이션, 또는 화자 분리 (speaker diarization) 기능이 포함된 저지연 ASR (Automatic Speech Recognition)이 필요한 사용자들을 위해 설계되었습니다.
Highlights
Ultra-low latency: 고급 스트리밍 정책을 사용하여 실시간 전사를 제공합니다.
Multiple Backends: Whisper, Voxtral Mini (4B parameters), Qwen3-ASR을 포함한 다양한 모델을 지원합니다.
Broad API Compatibility: OpenAI 및 Deepgram API의 즉시 교체 가능한 대체재입니다.
Multilingual Translation: NLLW를 통해 200개 언어 간의 동시 번역을줍니다.
Speaker DiAriesation: Sortformer 또는 Diart를 사용하여 실시간 화자 식별을 수행합니다.
Hardware Optimized: NVIDIA GPU (CUDA) 및 Apple Silicon (MLX/Metal)을 위한 전용 지원을 제공합니다.