k2-fsa/sherpa-onnx
Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages
What it solves
Sherpa-onnx 提供一种高度可移植且高效的方式,在本地运行各种语音和音频处理任务。它消除对复杂云端依赖的需求,让开发者能够在广泛的硬件平台和编程语言上部署语音转文字、文字转语音以及其他音频分析工具。
How it works
该项目利用 ONNX Runtime 在 CPU、GPU 或专用 NPU 上本地执行预训练模型。它支持多种音频功能,包括流式和非流式的 ASR、TTS、说话人分割和语音活动检测 (VAD)。系统设计以极致跨平台兼容性为目标,提供超过十种编程语言的 API,并支持几乎所有主要的操作系统和处理器架构。
Who it’s for
需要在本地、离线环境下执行音频功能的开发者,无论是高端服务器、移动设备 (Android、iOS)、嵌入式系统 (Raspberry Pi、Jetson) 或通过 WebAssembly 的浏览器,都适用。
Highlights
- Comprehensive Audio Suite: 支持 ASR、TTS、说话人识别、分割、音频标签与声源分离。
- Extreme Portability: 兼容 x86、ARM、RISC‑V 以及各种 NPU(Rockchip、Qualcomm、Ascend、Axera)。
- Broad Language Support: 提供 C++、C、Python、Go、C#、Java、Kotlin、JavaScript、Swift、Rust、Dart、Pascal 等 API。
- Local Execution: 为离线本地处理而设计,确保隐私并降低延迟。