k2-fsa/sherpa
Speech-to-text server framework with next-gen Kaldi
What it solves
사전 학습된 엔드‑투‑엔드 음성‑텍스트 변환 모델을 손쉽게 배포할 수 있게 하여, 음성을 전사만 하면 될 때 필요한 학습 인프라를 제거합니다.
How it works
이 프레임워크는 PyTorch를 이용해 transducer 및 CTC 기반 모델에서 추론을 수행합니다. C++와 Python API를 모두 제공하여 애플리케이션에 모델을 통합할 수 있습니다.
Who it’s for
사전 학습된 음성‑텍스트 변환 모델을 사용해 전사 작업을 수행하고 싶지만, 모델을 직접 학습하거나 파인튜닝할 필요가 없는 개발자를 위한 것입니다.
Highlights
- 엔드‑투‑엔드 (E2E) 모델에 초점
- C++와 Python API 지원
- PyTorch 기반
- 배포 및 추론 전용 설계