k2-fsa/sherpa-onnx

Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages

解决的问题

Sherpa-onnx 提供了一种高度可移植、以本地优先的语音和音频处理方法。它消除了对云 API 的依赖,使开发者能够在各种硬件平台和操作系统上直接运行复杂的音频 AI 模型——例如语音识别(ASR)、语音合成(TTS)和说话人识别。

工作原理

该项目利用 ONNX Runtime 在本地执行预训练模型。它提供了涵盖多种编程语言(包括 C++、Python、Go、Rust 和 Swift)的全面 API,并支持广泛的架构(x86、ARM、RISC-V)以及专用硬件加速器(如 NPUs:Rockchip、Qualcomm、Ascend、Intel OpenVINO)。

适用人群

需要在移动设备(Android、iOS)、桌面系统(Windows、macOS、Linux)和嵌入式系统(Raspberry Pi、NVIDIA Jetson)上实现低延迟、隐私保护或离线运行能力的音频应用开发者。

主要亮点

  • 丰富的音频功能套件:支持 ASR(流式与非流式)、TTS、说话人分离、VAD、关键词检测和音源分离。
  • 广泛的平台支持:兼容几乎所有主流操作系统和架构,包括 WebAssembly 和 HarmonyOS。
  • 多语言 API 支持:提供 12+ 种编程语言的绑定,便于集成到现有代码库中。
  • NPU 加速:原生支持多种 NPU,提升边缘设备上的性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目