QuentinFuxa/WhisperLiveKit
Real-time, local speech-to-text with streaming ASR, speaker diarization, translation, and OpenAI/Deepgram-compatible APIs.
解決的問題
WhisperLiveKit (WLK) 提供超低延遲、自架設的語音轉文字(STT)流程。它解決了使用 Whisper 等模型進行即時轉錄的問題,因為標準 Whisper 是針對完整語句設計,而非即時分段處理,這在小段處理時經常導致轉錄品質差與上下文遺失。
如何運作
WLK 實現先進的同步語音研究,以處理智慧緩衝與增量處理。支援多種後端,包括透過 SimulStreaming 和 LocalAgreement 政策的 Whisper、Voxtral、FunASR/SenseVoiceSmall、Qwen3-ASR 與 NVIDIA Canary-1b-v2。系統使用語音活動偵測(VAD)來減少開銷,可作為伺服器部署,支援 OpenAI 相容的 REST API、Deepgram 相容的 WebSocket 或原生 WebSocket 以實現即時串流。
適用對象
專為開發即時轉錄服務的開發者、需要跨數百種語言進行即時翻譯的應用程式,或需要在各種硬體(包括 NVIDIA GPU 與 Apple Silicon)上自架設、低延遲 ASR(自動語音辨識)的使用者設計。
主要特色
- 多後端支援:整合 Whisper、Voxtral、Qwen3-ASR 與 NVIDIA Canary。
- 超低延遲:使用 AlignAtt 與 LocalAgreement 等進階策略實現即時輸出。
- 廣泛的語言支援:透過 NLLW 支援 200 種語言的即時翻譯。
- 硬體優化:針對 Apple Silicon(MLX)與 NVIDIA CUDA 進行特定優化。
- 彈性 API:提供 OpenAI 相容的 REST 與 WebSocket 接口,方便整合。
- 進階功能:支援即時說話人分離(透過 Sortformer)與因果式串流音訊編碼器。
相關
- 專案
- 專案
- 專案
- 專案
- 專案