microsoft/Olive
Olive: Simplify ML Model Finetuning, Conversion, Quantization, and Optimization for CPUs, GPUs and NPUs.
解决的问题
Olive 简化了将 AI 模型优化以用于部署的过程。它解决了在特定硬件(云或边缘)上高效运行模型的同时,保持所需精度和延迟的最优化技术组合难题。
工作原理
Olive(ONNX LIVE)是一个工具包,接收模型和目标硬件规格。它组合一系列优化技术——如量化(例如 GPTQ 用于 int4 精度)和 ONNX 图优化——以生成优化后的 ONNX 模型。它可自动对 Llama、Phi、Qwen 和 Gemma 等流行架构进行优化,开箱即用。
适用人群
需要将 AI 模型部署到 ONNX Runtime 以在各种硬件目标(包括 NPU 和其他边缘设备)上实现高性能推理的开发者和机器学习工程师。
主要亮点
- 提供 CLI,可自动优化主流模型架构。
- 支持多种量化算法和技术,以减小模型大小并提升速度。
- 与 Hugging Face 集成,可直接获取模型。
- 针对 ONNX Runtime 优化,支持跨平台、设备端推理。
相关
- 项目
- 项目
- 项目
- 项目
- 项目