k2-fsa/sherpa-onnx
Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages
解決的問題
Sherpa-onnx 提供了一種高度可移植、以本地為先的語音與音訊處理方法。它消除了對雲端 API 的需求,讓開發者能在各種硬體平台與作業系統上直接執行複雜的音訊 AI 模型——例如語音辨識(ASR)、語音合成(TTS)與說話人辨識。
工作原理
此專案利用 ONNX Runtime 在本地執行預訓練模型。它提供涵蓋多種程式語言(包括 C++、Python、Go、Rust 和 Swift)的完整 API,並支援廣泛的架構(x86、ARM、RISC-V)以及專用硬體加速器(如 NPUs:Rockchip、Qualcomm、Ascend、Intel OpenVINO)。
適用對象
需要在行動裝置(Android、iOS)、桌面系統(Windows、macOS、Linux)與嵌入式系統(Raspberry Pi、NVIDIA Jetson)上實現低延遲、隱私保護或離線運作能力的語音應用開發者。
主要亮點
- 豐富的音訊功能套件:支援 ASR(串流與非串流)、TTS、說話人分離、VAD、關鍵字檢測與音源分離。
- 廣泛的平台支援:相容幾乎所有主流作業系統與架構,包括 WebAssembly 與 HarmonyOS。
- 多語言 API 支援:提供 12+ 種程式語言的封裝,便於整合至現有程式碼庫中。
- NPU 加速:原生支援多種 NPU,提升邊緣裝置上的效能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案