英特尔与 Hugging Face 的机器学习硬件加速合作

英特尔与 Hugging Face 合作,通过将英特尔的 AI 软件和 Xeon 硬件与 Hugging Face 生态系统集成,推动机器学习硬件加速的普及。此次合作的核心是 Optimum Intel 开源库,它简化了在英特尔平台上优化 Transformer 模型以获得更佳性能、规模和生产力的过程。

使用 Optimum Intel 简化 Transformer 加速

Optimum Intel 是更广泛的 Hugging Face Optimum 库的专用组件,旨在降低机器学习从业者进行延迟优化的复杂性。它基于 Intel Neural Compressor (INC),这是一款开源库,提供跨多种深度学习框架的网络压缩技术统一接口。

Intel Neural Compressor 提供的关键功能包括:

  • 量化:将模型参数的位宽降低(例如,从 32 位浮点数到 8 位整数),以减少内存和计算需求。
  • 剪枝:对对预测结果影响极小的模型参数进行置零或移除。
  • 知识蒸馏:在保持性能的同时压缩模型的技术。

Optimum Intel 让初学者和专家都能通过现成脚本或最少的代码修改,应用这些最先进的优化技术。

性能基准与硬件支持

此次合作利用了英特尔在加速 AI 方面的基础设施,特别是 Intel Xeon 可扩展 CPU 平台及其相关的硬件优化 AI 软件工具。

两组织之前的合作已展示出显著的性能提升:

  • 推理延迟:在 Intel Xeon Ice Lake CPU 上实现了 DistilBERT 的个位数毫秒延迟。
  • 训练效率:对 Habana Gaudi 加速器的支持相比 GPU 提供了高达 40% 的性价比提升。

案例研究:DistilBERT 的后训练量化

为了展示 Optimum Intel 的实用性,对一个针对鞋子评论分类进行微调的 DistilBERT 模型进行了案例研究。该过程使用后训练动态量化来缩减模型的内存和计算占用。

技术实现

使用 optimum.intel.neural_compressor 模块中的 INCQuantizer,对模型进行量化,配置允许在 10 次试验中最大精度下降 5%。该过程将标准的 Linear 层替换为 DynamicQuantizedLinear 层。

结果

对 38 个 Linear 和 2 个 Embedding 操作符进行量化后,产生了以下性能变化:

  • 执行速度:量化模型的评估步骤比原始模型快了 1.34 倍。
  • 精度:精度从 0.574 降至 0.546。
  • 延迟:评估过程的时长从 13.1534 秒降至 9.7695 秒。

未来展望

该合作旨在持续扩展 Optimum Intel 库的功能,超越后训练量化,加入更先进的剪枝和量化技术,以确保在 Intel Xeon CPU 和 Intel AI 库上的用户能够获得最佳效率。

Sources