huggingface/optimum

🚀 Accelerate inference and training of 🤗 Transformers, Diffusers, TIMM and Sentence Transformers with easy to use hardware optimization tools

What it solves

Optimum 簡化了在特定硬體加速器上訓練與執行 AI 模型的流程,確保模型達到最高效率,且使用者不必手動處理複雜的硬體特定最佳化。它擴充了 Transformers、Diffusers、TIMM 與 Sentence‑Transformers 等函式庫的功能。

How it works

Optimum 作為一層最佳化層,提供匯出、量化與執行模型於各種生態系的工具。它為不同硬體後端提供專門的 wrapper 與整合,包括:

  • Inference Engines: 支援 ONNX Runtime、OpenVINO、ExecuTorch、NVIDIA TensorRT‑LLM 與 AWS Inferentia。
  • Training Wrappers: 針對 Intel Gaudi(HPU)與 AWS Trainium 等硬體,提供基於 Transformers Trainer 的加速訓練 wrapper。
  • Quantization: 透過 API 或指令列使用 Quanto 進行 PyTorch 量化。

Who it’s for

需要將 AI 模型部署至目標硬體(邊緣裝置、GPU、NPU 與專用 AI 加速器)上生產環境的開發者與機器學習工程師,以及想要加速訓練流程的人員。

Highlights

  • Broad Hardware Support: 整合 NVIDIA、Intel(OpenVINO、Gaudi)、AMD、AWS(Trainium、Inferentia)與 FuriosaAI。
  • Seamless Export: 可輕鬆將模型匯出為 ONNX、ExecuTorch 等格式,以供裝置端推論使用。
  • Unified Interface: 以 Python API 或指令列介面提供一致的方式,最佳化與執行 Hugging Face 生態系的模型。
  • Accelerated Training: 簡化高效能硬體在模型訓練與微調上的使用。