openspeech-team/openspeech
Open-Source Toolkit for End-to-End Speech Recognition leveraging PyTorch-Lightning and Hydra.
해결하는 문제
OpenSpeech는 엔드투엔드(E2E) 자동 음성 인식(ASR) 시스템을 구축하는 것을 간소화하기 위해 설계된 프레임워크입니다. 별도로 복잡하게 음향 모델, 언어 모델, 발음 모델을 학습해야 하는 기존의 '하이브리드' ASR 시스템을 대체하여, 단일 통합 접근 방식을 제공함으로써 학습 및 디코딩 시간을 단축합니다.
작동 방식
PyTorch-Lightning과 Hydra 기반으로 구축된 OpenSpeech는 ASR 모델 학습을 위한 하드웨어에 의존하지 않는 환경을 제공합니다. 복잡한 엔지니어링 없이 혼합 정밀도 학습, 멀티노드 학습, TPU 지원과 같은 고급 기능을 활용할 수 있습니다. 이 프레임워크에는 20개 이상의 ASR 모델링 논문의 참조 구현이 포함되어 있으며, 스펙트로그램, 멜-스펙트로그램, 필터뱅크, MFCC와 같은 일반적인 오디오 특징과 SpecAugment을 포함한 다양한 데이터 증강 기법을 지원합니다.
대상 사용자
연구자, 교육자, 실무자에게 적합하며, 유명한 ASR 모델을 실험하거나 영어, 중국어, 한국어용 제공된 모듈과 레시피를 사용하여 맞춤형 음성 인식기 구축을 원하는 사람들을 대상으로 합니다.
주요 특징
- 풍부한 모델 라이브러리: Conformer, Transformer, Jasper, QuartzNet, DeepSpeech2 등을 포함한 20개 이상의 ASR 아키텍처를 지원합니다.
- 하드웨어 독립성: PyTorch-Lightning을 통해 GPU 및 TPU 학습을 원활하게 지원합니다.
- 언어 레시피: LibriSpeech(영어), AISHELL-1(중국어), KsponSpeech(한국어)용 사전 구성된 레시피를 포함합니다.
- 유연한 구성: 트레이닝 하이퍼파라미터의 계층적, 동적 구성 관리를 위해 Hydra를 사용합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트