istupakov/onnx-asr

A lightweight Python package for Automatic Speech Recognition using ONNX models

해결하는 문제

onnx-asr은 자동 음성 인식(ASR)을 빠르고 쉽게 배포할 수 있도록 설계된 경량 Python 패키지입니다. PyTorch, Transformers, FFmpeg와 같이 음성-텍스트 변환에 일반적으로 수반되는 무거운 종속성을 제거하여, ASR 모델을 소형 IoT/에지 장치부터 강력한 GPU 서버에 이르기까지 모든 환경에서 실행할 수 있도록 합니다.

작동 원리

이 프로젝트는 ONNX 형식으로 내보낸 최신 ASR 모델을 실행하는 데 필요한 전처리(log-mel spectrograms) 및 디코딩(greedy search) 구현을 제공합니다. NVIDIA NeMo (Parakeet, Canary), GigaAM, Kaldi Icefall Zipformer, Wav2Vec2, OpenAI Whisper를 포함한 다양한 아키텍처를 지원합니다.

대상 사용자

대규모 ML 프레임워크의 오버헤드 없이 Python에서 음성 인식을 구현해야 하는 개발자, 특히 Windows, Linux, macOS 환경의 에지 장치, IoT 또는 고성능 서버 환경을 대상으로 하는 개발자에게 적합합니다.

주요 특징

  • 최소한의 종속성: NumPy와 ONNX Runtime만 필요하며, PyTorch와 같은 무거운 프레임워크를 피할 수 있습니다.
  • 폭넓은 하드웨어 지원: x86 및 Arm CPU와 호환되며 CUDA, TensorRT, CoreML, DirectML, ROCm 및 WebGPU를 통한 가속을 지원합니다.
  • 유연한 모델 로딩: Hugging Face 또는 로컬 디렉토리에서 양자화된 버전을 포함한 모델을 직접 로드합니다.
  • 고급 ASR 기능: 배치 처리, 토큰 수준 타임스탬프, 로그 확률 및 음성 활동 감지(VAD)를 통한 긴 오디오 인식을 지원합니다.
  • 광범위한 모델 지원: NeMo Conformer, GigaAM, Whisper와 같은 다양한 최신 아키텍처와 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트