k2-fsa/sherpa

Speech-to-text server framework with next-gen Kaldi

What it solves

它提供了一种简化的方式来部署预训练的端到端语音转文字模型,省去在只需要转录语音时所必须的训练基础设施。

How it works

该框架使用 PyTorch 在 transducer 和 CTC 为基础的模型上执行推理。它同时提供 C++ 与 Python API,让这些模型能够整合到应用程序中。

Who it’s for

想要使用预训练语音转文字模型进行转录任务,且不需要自行训练或微调的开发者。

Highlights

  • 端到端 (E2E) 模型为核心
  • 支持 C++ 与 Python API
  • 基于 PyTorch 构建
  • 专为部署与推理设计