QuentinFuxa/WhisperLiveKit
Real-time, local speech-to-text with streaming ASR, speaker diarization, translation, and OpenAI/Deepgram-compatible APIs.
해결하는 문제
WhisperLiveKit (WLK)는 초저지연, 자체 호스팅 가능한 음성-텍스트 변환(STT) 파이프라인을 제공합니다. 일반적인 Whisper는 완전한 발화를 대상으로 설계되어 실시간 청크 처리에 적합하지 않으며, 작은 세그먼트로 처리할 경우 종종 잘못된 인식이 발생하고 맥락이 손실되는 문제가 있습니다.
작동 방식
WLK는 최첨단 동시 음성 연구를 구현하여 지능적인 버퍼링과 단계적 처리를 가능하게 합니다. SimulStreaming 및 LocalAgreement 정책을 통해 Whisper, Voxtral, FunASR/SenseVoiceSmall, Qwen3-ASR, NVIDIA Canary-1b-v2 등 다양한 백엔드를 지원합니다. 시스템은 음성 활동 탐지(VAD)를 사용하여 오버헤드를 줄일 수 있으며, OpenAI 호환 REST API, Deepgram 호환 WebSocket, 또는 네이티브 WebSocket을 통해 실시간 스트리밍용 서버로 배포할 수 있습니다.
대상 사용자
실시간 음성 인식 서비스를 개발하는 개발자, 수백 가지 언어 간 동시 번역이 필요한 애플리케이션 개발자, 또는 NVIDIA GPU와 Apple Silicon 등 다양한 하드웨어에서 자체 호스팅형 저지연 ASR(Automatic Speech Recognition)가 필요한 사용자에게 적합합니다.
주요 특징
- 다중 백엔드 지원: Whisper, Voxtral, Qwen3-ASR, NVIDIA Canary 통합.
- 초저지연: AlignAtt 및 LocalAgreement와 같은 고급 정책을 활용해 실시간 출력 가능.
- 광범위한 언어 지원: NLLW를 통해 200개 언어로 동시 번역 지원.
- 하드웨어 최적화: Apple Silicon(MLX) 및 NVIDIA CUDA 전용 최적화.
- 유연한 API: OpenAI 호환 REST 및 WebSocket 인터페이스 제공으로 간편한 통합 가능.
- 고급 기능: Sortformer를 통한 실시간 스피커 디아라이제이션 및 인과적 스트리밍 오디오 인코더 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트