microsoft/Olive
Olive: Simplify ML Model Finetuning, Conversion, Quantization, and Optimization for CPUs, GPUs and NPUs.
何を解決するか
Oliveは、AIモデルのデプロイを最適化するプロセスを簡素化します。特定のハードウェア(クラウドまたはエッジ)上でモデルが効率的に実行されるように、最適な最適化手法の組み合わせを見つける問題に対処します。同時に、必要な精度とレイテンシを維持します。
どう動くか
Olive(ONNX LIVE)は、モデルとターゲットハードウェア仕様を受け取ります。量子化(例:int4精度のGPTQ)やONNXグラフ最適化などの最適化手法のシーケンスを組み合わせ、最適化されたONNXモデルを生成します。Llama、Phi、Qwen、Gemmaなどの人気アーキテクチャを、オートメーションで即座に最適化できます。
対象ユーザー
NPUsやその他のエッジデバイスを含む、さまざまなハードウェアターゲット上で高パフォーマンスな推論を実現するため、AIモデルをONNX Runtimeにデプロイする必要がある開発者やMLエンジニア。
特徴
- 人気モデルアーキテクチャの自動最適化を可能にするCLIを提供。
- モデルサイズの削減と速度向上を実現する量子化アルゴリズムと技術をサポート。
- Hugging Faceと統合し、モデルを直接取得可能。
- ONNX Runtimeに最適化されており、クロスプラットフォーム、デバイス内での推論を可能に。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト