KoljaB/RealtimeSTT
A robust, efficient, low-latency speech-to-text library with advanced voice activity detection, wake word activation and instant transcription.
무엇을 해결하는가
RealtimeSTT는 음성 오디오를 실시간으로 텍스트로 변환하는 프로세스를 단순화합니다. 음성 활동 감지(VAD), 웨이크 워드(wake word) 활성화 및 오디오 스트림 처리를 수동으로 관리해야 하는 복잡성을 제거하여, 개발자가 최소한의 코드로 어시스턴트나 받아쓰기 도구에 음성-텍스트 변환 기능을 통합할 수 있도록 합니다.
작동 방식
이 라이브러리는 마이크에서 직접 오디오를 캡처하거나 외부 소스로부터 PCM 오디오 청크를 수신할 수 있는 AudioToTextRecorder를 제공합니다. 전사(transcription)를 수행하기 위해 모듈식 엔진 시스템을 사용하며, 기본값은 faster_whisper이지만 sherpa-onnx 및 kroko-onnx와 같은 다른 엔진도 지원합니다. VAD(WebRTC 또는 Silero를 통해)를 사용하여 사용자가 말을 시작하고 멈추는 시점을 감지하며, 녹화를 트리거하기 위해 웨이크 워드(Porcupine 또는 OpenWakeWord를 통해)를 통합할 수 있습니다.
대상 사용자
음성 제어 AI 어시스턴트, 받아쓰기 소프트웨어, 브라우저 기반 스트리밍 서버, 그리고 빠르고 로컬한 음성-텍스트 변환 기능이 필요한 신속한 프로토타입을 구축하는 개발자를 위해 설계되었습니다.
주요 특징
- 다양한 엔진 지원: faster-whisper, sherpa-onnx, Kroko-ONNX를 포함한 다양한 백엔드와 호환됩니다.
- 실시간 업데이트: 즉각적인 텍스트 가설(hypotheses)과 최종 확정 전사 결과 모두를 지원합니다.
- 유연한 오디오 입력: 라이브 마이크 또는 외부 오디오 스트림(파일, websockets)과 함께 작동합니다.
- 프로덕션 준비 완료: WebSocket 지원, 인증 및 세션 격리가 포함된 패키지화된 FastAPI 서버를 포함합니다.
- 통합된 VAD 및 웨이크 워드: 음성 감지 및 특정 트리거 단어에 대한 내장 지원을 제공합니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트