k2-fsa/sherpa-onnx
Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages
What it solves
Sherpa-onnx は、さまざまな音声・音声処理タスクをローカルで実行するための、非常にポータブルで効率的な方法を提供します。複雑なクラウド依存を排除し、開発者は多数のハードウェアプラットフォームとプログラミング言語上で音声認識、テキスト読み上げ、その他の音声分析ツールをデプロイできます。
How it works
本プロジェクトは ONNX Runtime を活用し、CPU、GPU、または専用 NPU 上で事前学習済みモデルをローカル実行します。ストリーミング・非ストリーミングの ASR、TTS、話者分離、音声活動検出 (VAD) など幅広い音声機能をサポートします。システムは極めて高いクロスプラットフォーム互換性を目指し、10 以上のプログラミング言語向け API を提供し、ほぼすべての主要 OS とプロセッサアーキテクチャをサポートします。
Who it’s for
ローカル・オフラインで音声機能を実行したい開発者向けです。高性能サーバーからモバイルデバイス (Android、iOS)、組み込みシステム (Raspberry Pi、Jetson)、WebAssembly を利用したブラウザまで、幅広く対応します。
Highlights
- Comprehensive Audio Suite: ASR、TTS、話者識別、ダイアリゼーション、音声タグ付け、音源分離をサポート。
- Extreme Portability: x86、ARM、RISC‑V、各種 NPU(Rockchip、Qualcomm、Ascend、Axera)に対応。
- Broad Language Support: C++、C、Python、Go、C#、Java、Kotlin、JavaScript、Swift、Rust、Dart、Pascal 向け API を提供。
- Local Execution: オフライン・ローカル処理向けに設計され、プライバシー保護とレイテンシ低減を実現。