k2-fsa/sherpa-onnx
Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages
何を解決するか
Sherpa-onnx は、音声およびオーディオ処理のための非常にポータブルでローカル優先のアプローチを提供します。クラウドベースのAPIの必要性を排除し、開発者が幅広いハードウェアプラットフォームおよびオペレーティングシステム上で、音声認識(ASR)、音声合成(TTS)、話者識別などの複雑なオーディオAIモデルを直接実行できるようにします。
動作方法
このプロジェクトは、事前に学習されたモデルをローカルで実行するために ONNX Runtime を活用しています。C++、Python、Go、Rust、Swift など多数のプログラミング言語に対応する包括的なAPIを提供しており、x86、ARM、RISC-V などの広範なアーキテクチャおよび Rockchip、Qualcomm、Ascend、Intel OpenVINO などの専用ハードウェアアクセラレータ(NPU)もサポートしています。
対象ユーザー
モバイル(Android、iOS)、デスクトップ(Windows、macOS、Linux)、および組み込みシステム(Raspberry Pi、NVIDIA Jetson)において、低レイテンシ、プライバシー、オフライン動作を必要とするオーディオ中心のアプリケーションを開発する開発者。
主な特徴
- 広範なオーディオ機能群: ASR(ストリーミングおよび非ストリーミング)、TTS、話者ダイアライゼーション、VAD、キーワード検出、音源分離をサポート。
- 大規模なプラットフォーム対応: WebAssembly および HarmonyOS を含む、ほぼすべての主要OSとアーキテクチャと互換性あり。
- 多言語API: 12種類以上のプログラミング言語のバインディングを提供し、既存のコードベースへの統合を容易にします。
- NPUアクセラレーション: エッジデバイスでのパフォーマンス向上を実現する、さまざまなNPUのネイティブサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト