microsoft/Olive

Olive: Simplify ML Model Finetuning, Conversion, Quantization, and Optimization for CPUs, GPUs and NPUs.

解决的问题

Olive 简化了将 AI 模型优化以用于部署的过程。它解决了在特定硬件(云或边缘)上高效运行模型的同时,保持所需精度和延迟的最优化技术组合难题。

工作原理

Olive(ONNX LIVE)是一个工具包,接收模型和目标硬件规格。它组合一系列优化技术——如量化(例如 GPTQ 用于 int4 精度)和 ONNX 图优化——以生成优化后的 ONNX 模型。它可自动对 Llama、Phi、Qwen 和 Gemma 等流行架构进行优化,开箱即用。

适用人群

需要将 AI 模型部署到 ONNX Runtime 以在各种硬件目标(包括 NPU 和其他边缘设备)上实现高性能推理的开发者和机器学习工程师。

主要亮点

  • 提供 CLI,可自动优化主流模型架构。
  • 支持多种量化算法和技术,以减小模型大小并提升速度。
  • 与 Hugging Face 集成,可直接获取模型。
  • 针对 ONNX Runtime 优化,支持跨平台、设备端推理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目