huggingface/optimum

🚀 Accelerate inference and training of 🤗 Transformers, Diffusers, TIMM and Sentence Transformers with easy to use hardware optimization tools

What it solves

Optimum 简化了在特定硬件加速器上训练和运行 AI 模型的过程,确保模型实现最高效率,而无需用户手动处理复杂的硬件特定优化。它扩展了 Transformers、Diffusers、TIMM 和 Sentence‑Transformers 等库的功能。

How it works

Optimum 充当一个优化层,提供导出、量化和在各种生态系统中运行模型的工具。它为不同硬件后端提供专门的包装器和集成,包括:

  • Inference Engines: 支持 ONNX Runtime、OpenVINO、ExecuTorch、NVIDIA TensorRT‑LLM 和 AWS Inferentia。
  • Training Wrappers: 为 Intel Gaudi(HPU)和 AWS Trainium 等硬件提供基于 Transformers Trainer 的加速训练包装器。
  • Quantization: 通过 API 或命令行使用 Quanto 进行 PyTorch 量化。

Who it’s for

需要将 AI 模型部署到目标硬件(边缘设备、GPU、NPU 和专用 AI 加速器)生产环境的开发者和机器学习工程师,以及希望加速训练流水线的人员。

Highlights

  • Broad Hardware Support: 集成 NVIDIA、Intel(OpenVINO、Gaudi)、AMD、AWS(Trainium、Inferentia)和 FuriosaAI。
  • Seamless Export: 轻松将模型导出为 ONNX、ExecuTorch 等格式,以进行设备端推理。
  • Unified Interface: 提供一致的方式,通过 Python API 或命令行界面优化和运行 Hugging Face 生态系统的模型。
  • Accelerated Training: 简化高性能硬件在模型训练和微调中的使用。