wenet-e2e/wenet

Production First and Production Ready End-to-End Speech Recognition Toolkit

해결하는 문제

WeNet는 end-to-end 음성 인식을 위한 프로덕션용 툴킷입니다. 정확하고 가벼우며 실제 프로덕션 환경을 위해 설계된 풀스택 솔루션을 제공함으로써 연구와 배포 사이의 간극을 메우는 것을 목표로 합니다.

작동 방식

WeNet는 스트리밍 및 비스트리밍 음성 인식을 모두 위한 프레임워크를 제공합니다. 영어 및 중국어 전사를 위해 Paraformer, FireRed, Whisper (large-v3 및 large-v3-turbo)와 같은 다양한 모델을 지원합니다. 시스템에는 쉬운 전사를 위한 Python 패키지와 배포를 위한 별도의 런타임이 포함되어 있으며, 성능 최적화를 위해 x86 플랫폼용으로 빌드할 수 있습니다.

대상

프로덕션 환경에서 고정밀 음성-텍스트 변환 시스템을 구현해야 하는 개발자 및 엔지니어와, end-to-end 음성 인식 모델을 구축하고 훈련하려는 연구자들을 대상으로 합니다.

주요 특징

  • 프로덕션 준비 완료: 풀스택 솔루션을 갖추고 프로덕션 환경을 위해 특별히 설계되었습니다.
  • SOTA 결과: 다양한 공개 음성 데이터셋에서 최첨단(state-of-the-art) 결과를 달성합니다.
  • 간편한 설치: 빠른 시작을 위한 Python 패키지 또는 훈련 및 배포를 위한 전체 설치를 제공합니다.
  • 폭넓은 하드웨어 지원: 가속을 위해 CUDA 및 Ascend NPU를 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트