huggingface/optimum
🚀 Accelerate inference and training of 🤗 Transformers, Diffusers, TIMM and Sentence Transformers with easy to use hardware optimization tools
What it solves
Optimum 简化了在特定硬件加速器上训练和运行 AI 模型的过程,确保模型实现最高效率,而无需用户手动处理复杂的硬件特定优化。它扩展了 Transformers、Diffusers、TIMM 和 Sentence‑Transformers 等库的功能。
How it works
Optimum 充当一个优化层,提供导出、量化和在各种生态系统中运行模型的工具。它为不同硬件后端提供专门的包装器和集成,包括:
- Inference Engines: 支持 ONNX Runtime、OpenVINO、ExecuTorch、NVIDIA TensorRT‑LLM 和 AWS Inferentia。
- Training Wrappers: 为 Intel Gaudi(HPU)和 AWS Trainium 等硬件提供基于 Transformers Trainer 的加速训练包装器。
- Quantization: 通过 API 或命令行使用 Quanto 进行 PyTorch 量化。
Who it’s for
需要将 AI 模型部署到目标硬件(边缘设备、GPU、NPU 和专用 AI 加速器)生产环境的开发者和机器学习工程师,以及希望加速训练流水线的人员。
Highlights
- Broad Hardware Support: 集成 NVIDIA、Intel(OpenVINO、Gaudi)、AMD、AWS(Trainium、Inferentia)和 FuriosaAI。
- Seamless Export: 轻松将模型导出为 ONNX、ExecuTorch 等格式,以进行设备端推理。
- Unified Interface: 提供一致的方式,通过 Python API 或命令行界面优化和运行 Hugging Face 生态系统的模型。
- Accelerated Training: 简化高性能硬件在模型训练和微调中的使用。