KoljaB/RealtimeSTT
A robust, efficient, low-latency speech-to-text library with advanced voice activity detection, wake word activation and instant transcription.
它解決了什麼問題
RealtimeSTT 簡化了即時將語音轉換為文字的流程。它移除了手動管理語音活動檢測(VAD)、喚醒詞觸發和音訊串流處理的複雜性,讓開發者能以最少的程式碼將語音轉文字功能整合至助理或文字輸入工具中。
它如何運作
該程式庫提供了一個 AudioToTextRecorder,可直接從麥克風捕獲音訊,或接收來自外部來源的 PCM 音訊片段。它使用模組化引擎系統——預設採用 faster_whisper,但亦支援 sherpa-onnx 和 kroko-onnx 等其他引擎——進行轉錄。它利用 VAD(透過 WebRTC 或 Silero)偵測使用者開始與結束說話的時機,並可整合喚醒詞(透過 Porcupine 或 OpenWakeWord)以觸發錄音。
適用對象
適用於開發語音控制的人工智慧助理、文字輸入軟體、瀏覽器端串流伺服器,以及需要快速、本地化語音轉文字功能的快速原型開發者。
主要特色
- 多重引擎支援:相容於多種後端,包括 faster-whisper、sherpa-onnx 和 Kroko-ONNX。
- 即時更新:支援即時文字假設與最終權威性轉錄。
- 彈性音訊輸入:支援即時麥克風或外部音訊串流(檔案、WebSocket)。
- 生產就緒:內建封裝好的 FastAPI 伺服器,支援 WebSocket、驗證與會話隔離。
- 內建 VAD 與喚醒詞:內建支援語音偵測與特定觸發詞。
"This library makes real-time speech-to-text integration effortless." — @realtime_stt
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案