microsoft/Olive
Olive: Simplify ML Model Finetuning, Conversion, Quantization, and Optimization for CPUs, GPUs and NPUs.
解決的問題
Olive 簡化了將 AI 模型優化以用於部署的過程。它解決了在特定硬體(雲端或邊緣)上高效執行模型的同時,維持所需準確度與延遲的最適化技術組合問題。
工作原理
Olive(ONNX LIVE)是一個工具包,接收模型與目標硬體規格。它組合一系列優化技術——例如量化(如 GPTQ 用於 int4 精度)與 ONNX 圖形優化——以產生優化後的 ONNX 模型。它可自動對 Llama、Phi、Qwen 和 Gemma 等流行架構進行優化,開箱即用。
適用對象
需要將 AI 模型部署至 ONNX Runtime,以在各種硬體目標(包括 NPU 和其他邊緣裝置)上實現高效能推論的開發者與機器學習工程師。
主要亮點
- 提供 CLI,可自動優化主流模型架構。
- 支援多種量化演算法與技術,以縮小模型大小並提升速度。
- 與 Hugging Face 整合,可直接取得模型。
- 對 ONNX Runtime 優化,支援跨平台、裝置端推論。
相關
- 專案
- 專案
- 專案
- 專案
- 專案