k2-fsa/sherpa-onnx
Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages
해결하는 문제
Sherpa-onnx는 음성 및 오디오 처리를 위한 매우 포터블하고 로컬 우선의 접근 방식을 제공합니다. 클라우드 기반 API가 필요 없으며, 개발자가 다양한 하드웨어 플랫폼과 운영 체제에서 음성 인식(ASR), 음성 합성(TTS), 화자 식별과 같은 복잡한 오디오 AI 모델을 직접 실행할 수 있게 합니다.
작동 방식
이 프로젝트는 사전 훈련된 모델을 로컬에서 실행하기 위해 ONNX Runtime을 활용합니다. C++, Python, Go, Rust, Swift 등 다양한 프로그래밍 언어를 지원하는 포괄적인 API를 제공하며, x86, ARM, RISC-V 등 다양한 아키텍처와 Rockchip, Qualcomm, Ascend, Intel OpenVINO 등의 전용 하드웨어 가속기(NPU)도 지원합니다.
대상 사용자
모바일(안드로이드, iOS), 데스크톱(윈도우, 맥OS, 리눅스), 임베디드 시스템(Raspberry Pi, NVIDIA Jetson)에서 낮은 지연 시간, 프라이버시, 오프라인 기능이 필요한 오디오 중심 애플리케이션을 개발하는 개발자들.
주요 특징
- 광범위한 오디오 기능 세트: ASR(스트리밍 및 비스트리밍), TTS, 화자 분리, VAD, 키워드 탐지, 소스 분리 지원.
- 대규모 플랫폼 지원: 웹어셈블리 및 하모니OS를 포함해 거의 모든 주요 OS와 아키텍처와 호환.
- 다양한 언어 API: 12개 이상의 프로그래밍 언어 바인딩 제공으로 기존 코드베이스에 쉽게 통합 가능.
- NPU 가속: 엣지 디바이스에서 성능을 향상시키기 위한 다양한 NPU의 네이티브 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트