Uberi/speech_recognition
Speech recognition module for Python, supporting several engines and APIs, online and offline.
해결하는 문제
이 라이브러리는 Python에서 음성 인식을 수행하기 위한 통합 인터페이스를 제공하여, 개발자가 핵심 로직을 다시 작성하지 않고도 다양한 음성-텍스트 변환 엔진 및 API 사이를 쉽게 전환할 수 있도록 합니다. 마이크 또는 파일에서 오디오를 캡처하고 이를 텍스트로 변환하는 프로세스를 단순화하며, 온라인 클라우드 서비스와 오프라인 로컬 엔진을 모두 지원합니다.
작동 방식
이 라이브러리는 여러 음성 인식 백엔드를 감싸는 래퍼 역할을 합니다. 오디오 입력(마이크의 경우 PyAudio 사용)을 처리하기 위한 일관된 도구 세트를 제공한 다음, 해당 오디오를 선택한 인식 엔진으로 라우팅합니다. 지원되는 백엔드는 다음과 같습니다:
- 오프라인 엔진: CMU Sphinx, Vosk, OpenAI Whisper
- 온라인 API: Google Speech Recognition, Google Cloud Speech, Wit.ai, Microsoft Azure Speech, Houndify, IBM Speech to Text, OpenAI Transcription API, Groq Whisper API, Cohere Transcribe API
또한 주변 소음을 보정하고 오디오 데이터 인코딩(예: FLAC 사용)을 관리하기 위한 유틸리티 함수도 포함되어 있습니다.
대상 사용자
음성 제어 애플리케이션, 전사 도구 또는 다양한 AI 모델과 서비스를 사용하여 음성 오디오를 텍스트로 변환해야 하는 소프트웨어를 구축하는 개발자.
주요 특징
- 멀티 엔진 지원: 광범위한 로컬 및 클라우드 기반 음성-텍스트 제공업체와 호환됩니다.
- 온라인 및 오프라인: Sphinx, Vosk 또는 Whisper를 통해 프라이버시 또는 저지연 요구 사항을 위한 완전한 오프라인 인식을 지원합니다.
- 유연한 입력: 마이크에서 직접 또는 기존 오디오 파일에서 오디오를 처리할 수 있습니다.
- 주변 소음 처리: 배경 소음을 더 잘 처리하기 위해 에너지 임계값을 보정하는 기능이 포함되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트