microsoft/Olive

Olive: Simplify ML Model Finetuning, Conversion, Quantization, and Optimization for CPUs, GPUs and NPUs.

해결하는 문제

Olive는 AI 모델을 배포하기 위한 최적화 과정을 단순화합니다. 특정 하드웨어(클라우드 또는 엣지)에서 모델이 효율적으로 실행되도록 하면서 필요한 정확도와 지연 시간을 유지하기 위해 최적의 최적화 기법 조합을 찾는 문제를 해결합니다.

작동 방식

Olive(ONNX LIVE)는 모델과 타겟 하드웨어 사양을 입력받습니다. 양자화(GPTQ를 통한 int4 정밀도 등) 및 ONNX 그래프 최적화와 같은 최적화 기법의 시퀀스를 조합하여 최적화된 ONNX 모델을 생성합니다. Llama, Phi, Qwen, Gemma와 같은 인기 있는 아키텍처를 즉시 자동으로 최적화할 수 있습니다.

대상 사용자

NPUs 및 기타 엣지 장치를 포함한 다양한 하드웨어 타겟에서 고성능 추론을 위해 AI 모델을 ONNX Runtime에 배포해야 하는 개발자 및 ML 엔지니어.

주요 기능

  • 인기 있는 모델 아키텍처의 자동 최적화를 위한 CLI 제공.
  • 모델 크기 축소 및 속도 향상을 위한 양자화 알고리즘 및 기법 지원.
  • Hugging Face와 통합되어 모델을 직접 가져올 수 있음.
  • ONNX Runtime에 최적화되어 크로스플랫폼 및 디바이스 내 추론을 가능하게 함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트