yeyupiaoling/MASR

Pytorch实现的流式与非流式的自动语音识别框架,同时兼容在线和离线识别,目前支持Conformer、Squeezeformer、DeepSpeech2模型,支持多种数据增强方法。

해결하는 문제

MASR(Magical Automatic Speech Recognition)는 자동 음성 인식(ASR)을 간단하고 실용적으로 만들기 위해 설계된 PyTorch 기반 프레임워크입니다. 다양한 언어와 플랫폼에서 실시간(스트리밍) 및 배치(비스트리밍) 처리를 지원하는 음성을 텍스트로 변환하는 통합 시스템을 제공합니다.

작동 방식

이 프레임워크는 음성 전처리에서 최종 텍스트 출력까지 완전한 ASR 파이프라인을 구현합니다:

  • 모델: Conformer, Squeezeformer, Efficient Conformer, DeepSpeech2 등 다양한 아키텍처를 지원합니다.
  • 전처리: fbank 및 mfcc와 같은 방법을 사용하여 음성을 처리하며, kaldi_native_fbank 라이브러리를 활용해 속도 향상과 크로스플랫폼 호환성을 개선합니다.
  • 디코딩: CTC 그리디 검색, CTC 프리픽스 비임 검색, CTC 비임 검색, 어텐션 리스코어링 등의 다양한 디코딩 전략을 사용합니다.
  • 토큰화: sentencepiece를 사용하여 토큰화하며, 다국어 처리를 간소화하고 중국어와 영어의 혼합 학습을 가능하게 합니다.
  • 데이터 증강: 노이즈, 리버버레이션, 속도, 볼륨, 리샘플링, 시프트 증강뿐만 아니라 SpecAugment와 SpecSubAugment를 포함하여 강건성을 향상시킵니다.

대상 사용자

MASR는 서버, Nvidia Jetson 장치, 그리고 향후 모바일 장치(안드로이드)에서 실행 가능한 배포 가능한 ASR 시스템이 필요한 개발자 및 연구자를 대상으로 합니다.

주요 특징

  • 유연한 추론: 짧은 오디오, 긴 오디오, 스트리밍, 화자 분리 기반 추론을 모두 지원합니다.
  • 다국어 지원: 중국어(표준어), 영어, 광둥어, 우이구르어를 포함하여 중국어-영어 혼합 모델도 처리 가능합니다.
  • 크로스플랫폼: Windows, Linux, macOS와 호환됩니다.
  • 포괄적인 도구: 데이터 준비, 합성 음성 생성, 모델 학습, 평가, 모델 내보내기용 내장 스크립트를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트