istupakov/onnx-asr
A lightweight Python package for Automatic Speech Recognition using ONNX models
解決する課題
onnx-asr は、自動音声認識 (ASR) を高速かつ簡単にデプロイできるように設計された軽量なPythonパッケージです。PyTorch、Transformers、FFmpegといった、音声からテキストへの変換に通常伴う重い依存関係を排除し、ASRモデルを小型のIoT/エッジデバイスから強力なGPUサーバーまで、あらゆる環境で実行できるようにします。
仕組み
このプロジェクトは、ONNX形式にエクスポートされた最新のASRモデルを実行するために必要な前処理 (log-mel spectrograms) とデコード (greedy search) の実装を提供します。NVIDIA NeMo (Parakeet, Canary)、GigaAM、Kaldi Icefall Zipformer、Wav2Vec2、OpenAI Whisperなど、幅広いアーキテクチャをサポートしています。
対象ユーザー
大規模なMLフレームワークのオーバーヘッドなしに、Pythonで音声認識を実装する必要がある開発者、特にWindows、Linux、macOS上のエッジデバイス、IoT、または高性能サーバー環境をターゲットとする開発者に適しています。
特徴
- 最小限の依存関係: NumPyとONNX Runtimeのみが必要で、PyTorchのような重いフレームワークを回避します。
- 幅広いハードウェアサポート: x86およびArm CPUと互換性があり、CUDA、TensorRT、CoreML、DirectML、ROCm、WebGPUによる加速をサポートしています。
- 柔軟なモデルロード: Hugging Faceまたはローカルディレクトリから、量子化されたバージョンを含むモデルを直接ロードできます。
- 高度なASR機能: バッチ処理、トークンレベルのタイムスタンプ、対数確率、および音声活動検出 (VAD) による長尺の認識をサポートしています。
- 幅広いモデルサポート: NeMo Conformer、GigaAM、Whisperなどの様々な最新アーキテクチャと互換性があります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト