k2-fsa/sherpa
Speech-to-text server framework with next-gen Kaldi
What it solves
它提供了一种简化的方式来部署预训练的端到端语音转文字模型,省去在只需要转录语音时所必须的训练基础设施。
How it works
该框架使用 PyTorch 在 transducer 和 CTC 为基础的模型上执行推理。它同时提供 C++ 与 Python API,让这些模型能够整合到应用程序中。
Who it’s for
想要使用预训练语音转文字模型进行转录任务,且不需要自行训练或微调的开发者。
Highlights
- 端到端 (E2E) 模型为核心
- 支持 C++ 与 Python API
- 基于 PyTorch 构建
- 专为部署与推理设计