k2-fsa/sherpa
Speech-to-text server framework with next-gen Kaldi
What it solves
它提供了一種簡化的方式來部署預訓練的端到端語音轉文字模型,省去在只需要轉錄語音時所必須的訓練基礎設施。
How it works
該框架使用 PyTorch 在 transducer 與 CTC 為基礎的模型上執行推論。它同時提供 C++ 與 Python API,讓這些模型能夠整合到應用程式中。
Who it’s for
想要使用預訓練語音轉文字模型進行轉錄任務,且不需要自行訓練或微調的開發者。
Highlights
- 端到端 (E2E) 模型為核心
- 支援 C++ 與 Python API
- 基於 PyTorch 建置
- 專為部署與推論設計