TensorSpeech/TensorFlowASR
:zap: TensorFlowASR: Almost State-of-the-art Automatic Speech Recognition in Tensorflow 2. Supported languages that can use characters or subwords
What it solves
다양한 최첨단 신경망 아키텍처를 사용하여 음성 오디오를 텍스트로 변환할 수 있는 자동 음성 인식 (ASR) 시스템 구축 및 학습을 위한 프레임워크를를 제공합니다.
How it works
이 프로젝트는 학습 손실 함수에 따라 분류된 여러 ASR 아키텍처를를 구현합니다: RNNT Loss를 사용하는 Transducer 모델 (Conformer, ContextNet) 및 CTC Loss를 사용하는 CTC 모델 (DeepSpeech2, DeepSpeech2) 및 Jasper.
특징 추출 및 데이터 증강을 위한 도구를 포함하며, 학습된 모델을 TFLite 형식으로 변환하여 배포 시 메모리 및 연산량을 최적화할 수 있습니다.
Who it’s for
TensorFlow 생태계를 선호하며 TFLite를 통해 엣지 디바이스에 배포할 수 있는 모델이 필요한 음성-텍스트 변환 애플리케이션 개발자 및 연구자입니다.
Highlights
- 다양한 아키텍처 지원: Conformer, ContextNet, RNN Transducer, DeepSpeech2, Jasper.
- Streaming Conformer를 통한 스트리밍 기능 제공.
- 효율적인 배포를 위한 TFLite 변환 경로 제공.
- 영어 (LibriSpeech, Common Voice) 및 베트남어 코퍼스를 포함한 다양한 데이터셋 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트