flashlight/wav2letter

Facebook AI Research's Automatic Speech Recognition Toolkit

해결하는 문제

wav2letter++는 엔드 투 엔드 자동 음성 인식(ASR)을 위한 고성능 프레임워크를 제공하도록 설계되었으며, 다양한 연구 논문의 재현과 음성을 텍스트로 변환하기 위한 사전 학습된 모델의 사용을 가능하게 합니다.

작동 방식

이 프로젝트는 Flashlight 머신러닝 라이브러리와 통합되는 일련의 레시피와 사전 학습된 모델을 제공합니다. 스트리밍 ConvNets, 시간-깊이 분리 합성곱(time-depth separable convolutions)을 사용하는 sequence-to-sequence 모델, 그리고 어휘 사전 없는(lexicon-free) 음성 인식을 포함한 다양한 ASR 아키텍처를 지원합니다.

대상

주로 음성 인식 분야에서 연구하거나 개발하는 연구자 및 개발자, 특히 학술적 결과를 재현하거나 최첨단 ASR 아키텍처를 구현하고자 하는 분들을 대상으로 합니다.

주요 특징

  • ConvNets 및 Seq2Seq를 포함하여 연구로 검증된 다양한 ASR 아키텍처 지원.
  • 음성 인식을 위한 준지도 학습 및 자기 학습 레시피 제공.
  • 즉시 사용 가능한 사전 학습된 모델 포함.
  • 고성능 실행을 위한 Flashlight 라이브러리와의 통합.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트