KoljaB/RealtimeSTT

A robust, efficient, low-latency speech-to-text library with advanced voice activity detection, wake word activation and instant transcription.

它解决了什么问题

RealtimeSTT 简化了将实时语音音频转换为文本的过程。它消除了手动管理语音活动检测(VAD)、唤醒词激活和音频流处理的复杂性,使开发者能够以最少的代码将语音转文本功能集成到助手或语音输入工具中。

它如何工作

该库提供了一个 AudioToTextRecorder,可直接从麦克风捕获音频,或接收来自外部源的 PCM 音频块。它使用模块化引擎系统——默认使用 faster_whisper,但也支持 sherpa-onnxkroko-onnx 等其他引擎——进行语音转录。它利用 VAD(通过 WebRTC 或 Silero)检测用户开始和停止说话的时刻,并可集成唤醒词(通过 Porcupine 或 OpenWakeWord)来触发录音。

适用人群

专为开发语音控制的 AI 助手、语音输入软件、基于浏览器的流媒体服务器以及需要快速本地语音转文本功能的快速原型的开发者设计。

特性亮点

  • 多种引擎支持:兼容多种后端,包括 faster-whisper、sherpa-onnx 和 Kroko-ONNX。
  • 实时更新:支持即时文本推测和最终权威转录。
  • 灵活的音频输入:支持实时麦克风或外部音频流(文件、WebSocket)。
  • 生产就绪:包含一个打包好的 FastAPI 服务器,支持 WebSocket、认证和会话隔离。
  • 集成 VAD 和唤醒词:内置语音检测和特定触发词支持。

一个真正实时的语音转文本库,集成了 VAD 和唤醒词功能,支持多种转录引擎——@realtime_stt

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目