microsoft/Olive

Olive: Simplify ML Model Finetuning, Conversion, Quantization, and Optimization for CPUs, GPUs and NPUs.

解決的問題

Olive 簡化了將 AI 模型優化以用於部署的過程。它解決了在特定硬體(雲端或邊緣)上高效執行模型的同時,維持所需準確度與延遲的最適化技術組合問題。

工作原理

Olive(ONNX LIVE)是一個工具包,接收模型與目標硬體規格。它組合一系列優化技術——例如量化(如 GPTQ 用於 int4 精度)與 ONNX 圖形優化——以產生優化後的 ONNX 模型。它可自動對 Llama、Phi、Qwen 和 Gemma 等流行架構進行優化,開箱即用。

適用對象

需要將 AI 模型部署至 ONNX Runtime,以在各種硬體目標(包括 NPU 和其他邊緣裝置)上實現高效能推論的開發者與機器學習工程師。

主要亮點

  • 提供 CLI,可自動優化主流模型架構。
  • 支援多種量化演算法與技術,以縮小模型大小並提升速度。
  • 與 Hugging Face 整合,可直接取得模型。
  • 對 ONNX Runtime 優化,支援跨平台、裝置端推論。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案