huggingface/optimum

🚀 Accelerate inference and training of 🤗 Transformers, Diffusers, TIMM and Sentence Transformers with easy to use hardware optimization tools

What it solves

Optimum은 특정 하드웨어 가속기에서 AI 모델을 학습하고 실행하는 과정을 단순화하여, 사용자가 복잡한 하드웨어별 최적화를 직접 처리하지 않아도 최대 효율을 달성하도록 합니다. Transformers, Diffusers, TIMM, Sentence‑Transformers와 같은 라이브러리의 기능을 확장합니다.

How it works

Optimum은 최적화 레이어 역할을 하며, 모델을 내보내고(Export), 양자화(Quantize)하며 다양한 생태계에서 실행할 수 있는 도구를 제공합니다. 다음과 같은 하드웨어 백엔드에 특화된 래퍼와 통합을 제공합니다.

  • Inference Engines: ONNX Runtime, OpenVINO, ExecuTorch, NVIDIA TensorRT‑LLM, AWS Inferentia 지원.
  • Training Wrappers: Intel Gaudi(HPU)와 AWS Trainium 등 하드웨어에서 가속 학습을 가능하게 하는 Transformers Trainer 기반 래퍼 제공.
  • Quantization: API 또는 명령줄을 통해 Quanto를 사용한 PyTorch 양자화 도구.

Who it’s for

대상 하드웨어(엣지 디바이스, GPU, NPU, 특수 AI 가속기)에서 AI 모델을 프로덕션에 배포해야 하는 개발자 및 ML 엔지니어, 그리고 학습 파이프라인을 가속화하고자 하는 사람들을 위한 것입니다.

Highlights

  • Broad Hardware Support: NVIDIA, Intel(OpenVINO, Gaudi), AMD, AWS(Trainium, Inferentia), FuriosaAI와 통합.
  • Seamless Export: ONNX, ExecuTorch 등 포맷으로 모델을 손쉽게 내보내어 디바이스에서 추론 가능.
  • Unified Interface: Python API 또는 CLI를 통해 Hugging Face 생태계 모델을 일관된 방식으로 최적화하고 실행.
  • Accelerated Training: 고성능 하드웨어를 활용한 모델 학습 및 파인튜닝을 간소화.