Intel 與 Hugging Face 合作推動機器學習硬體加速

Intel 與 Hugging Face 合作,透過將 Intel 的 AI 軟體與 Xeon 硬體整合至 Hugging Face 生態系統,讓機器學習硬體加速更加普及。此合作的核心是 Optimum Intel 開源函式庫,該函式庫簡化了在 Intel 平台上優化 Transformer 模型以提升效能、規模與生產力的過程。

使用 Optimum Intel 簡化 Transformer 加速

Optimum Intel 是 Hugging Face Optimum 函式庫的專門元件,旨在降低機器學習從業者在延遲優化方面的複雜度。它基於 Intel Neural Compressor (INC),這是一個開源函式庫,提供跨多種深度學習框架的網路壓縮技術統一介面。

Intel Neural Compressor 提供的主要功能包括:

  • Quantization:將模型參數的位元寬度降低(例如,從 32 位元浮點數降至 8 位元整數),以減少記憶體與計算需求。
  • Pruning:將對預測結果影響極小的模型參數置零或移除。
  • Knowledge Distillation:在保持效能的同時壓縮模型的技術。

Optimum Intel 讓初學者與專家皆能透過現成腳本或最少的程式碼變更,套用這些最先進的優化技術。

效能基準與硬體支援

此合作利用 Intel 在加速 AI 方面的基礎,特別是 Intel Xeon Scalable CPU 平台以及其相關的硬體最佳化 AI 軟體工具。

兩家公司先前的合作已展示出顯著的效能提升:

  • Inference Latency:在 Intel Xeon Ice Lake CPU 上,DistilBERT 的推論延遲達到單位數毫秒。
  • Training Efficiency:支援 Habana Gaudi 加速器,相較於 GPU 可提供高達 40% 的性價比提升。

案例研究:DistilBERT 的後訓練量化

為展示 Optimum Intel 的實用性,我們在一個針對鞋子評論分類微調的 DistilBERT 模型上進行了案例研究。此過程使用後訓練動態量化,以縮減模型的記憶體與計算佔用。

技術實作

使用來自 optimum.intel.neural_compressor 模組的 INCQuantizer,將模型以允許在 10 次試驗中最大精度下降 5% 的設定進行量化。此過程將標準的 Linear 層替換為 DynamicQuantizedLinear 層。

結果

對 38 個 Linear 與 2 個 Embedding 運算子進行量化後,產生了以下效能變化:

  • Execution Speed:量化模型的評估步驟比原始模型快 1.34 倍。
  • Accuracy:精度從 0.574 降至 0.546。
  • Latency:評估過程的時間從 13.1534 秒縮短至 9.7695 秒。

未來展望

此合作旨在持續擴充 Optimum Intel 函式庫的功能,從後訓練量化延伸至更進階的剪枝與量化技術,確保在 Intel Xeon CPU 與 Intel AI 函式庫上的使用者能達到最佳效能。

Sources