k2-fsa/sherpa-onnx
Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages
What it solves
Sherpa-onnx 提供一種高度可移植且高效的方式,在本機執行各種語音與音訊處理任務。它消除對複雜雲端依賴的需求,讓開發者能在廣泛的硬體平台與程式語言上部署語音轉文字、文字轉語音以及其他音訊分析工具。
How it works
此專案利用 ONNX Runtime 在 CPU、GPU 或專用 NPU 上本機執行預訓練模型。它支援多種音訊功能,包括串流與非串流的 ASR、TTS、說話者分割與語音活動偵測 (VAD)。系統設計以極致跨平台相容性為目標,提供超過十種程式語言的 API,並支援幾乎所有主要的作業系統與處理器架構。
Who it’s for
需要在本機、離線環境下執行音訊功能的開發者,無論是高階伺服器、行動裝置 (Android、iOS)、嵌入式系統 (Raspberry Pi、Jetson) 或透過 WebAssembly 的瀏覽器,都適用。
Highlights
- Comprehensive Audio Suite: 支援 ASR、TTS、說話者辨識、分割、音訊標籤與聲源分離。
- Extreme Portability: 相容於 x86、ARM、RISC‑V 以及各種 NPU(Rockchip、Qualcomm、Ascend、Axera)。
- Broad Language Support: 提供 C++、C、Python、Go、C#、Java、Kotlin、JavaScript、Swift、Rust、Dart、Pascal 等 API。
- Local Execution: 為離線本機處理而設計,確保隱私並降低延遲。