k2-fsa/sherpa

Speech-to-text server framework with next-gen Kaldi

What it solves

它提供了一種簡化的方式來部署預訓練的端到端語音轉文字模型,省去在只需要轉錄語音時所必須的訓練基礎設施。

How it works

該框架使用 PyTorch 在 transducer 與 CTC 為基礎的模型上執行推論。它同時提供 C++ 與 Python API,讓這些模型能夠整合到應用程式中。

Who it’s for

想要使用預訓練語音轉文字模型進行轉錄任務,且不需要自行訓練或微調的開發者。

Highlights

  • 端到端 (E2E) 模型為核心
  • 支援 C++ 與 Python API
  • 基於 PyTorch 建置
  • 專為部署與推論設計