文本生成推理 (TGI) Intel Gaudi 整合

Hugging Face 已在文本生成推理 (TGI) 中原生整合 Intel Gaudi 硬體支援,使得能夠在 Intel 專用 AI 加速器上部署大型語言模型 (LLM),並使用可投入生產的服務堆疊。此整合消除了需要額外分支的情況,讓 Gaudi 使用者能即時取得最新的 TGI 功能。

統一後端架構

TGI 現在直接在主程式碼庫中支援 Intel Gaudi(透過 PR #3091),取代先前必須使用獨立 tgi-gaudi 分支的需求。此轉變得以透過全新的 TGI 多後端架構實現,簡化使用者體驗,並確保 Gaudi 硬體在 TGI 生態系中被視為一等公民。

支援的 Intel Gaudi 硬體

此整合支援完整系列的 Intel Gaudi 加速器,包括:

  • Gaudi1:可於 AWS EC2 DL1 實例取得。
  • Gaudi2:可於 Intel Tiber AI Cloud 與 Denvr Dataworks 取得。
  • Gaudi3:可於 Intel Tiber AI Cloud、IBM Cloud,以及包括 Dell、HP、Supermicro 在內的 OEM 取得。

主要功能與生產效益

Gaudi 後端將 TGI 的生產等級功能帶到 Intel 硬體,提供傳統 GPU 部署的替代方案。主要優勢包括:

  • Production-Ready Features:支援動態批次處理與串流回應。
  • Deployment Flexibility:提升硬體多樣性,針對特定工作負載提供具競爭力的性價比。
  • Advanced Technical Support:支援多卡推論(sharding)、視覺語言模型與 FP8 精度。

最佳化模型支援

Hugging Face 已針對 Intel Gaudi 硬體最佳化模型程式碼,以在單卡與多卡配置下達到最高效能。目前已為 Gaudi 最佳化的模型包括:

  • Llama Series:Llama 3.1(8B 與 70B)、Llama 3.3(70B)以及 Llama 3.2 Vision(11B)。
  • Mistral/Mixtral:Mistral(7B)與 Mixtral(8x7B)。
  • Other Architectures:CodeLlama(13B)、Falcon(180B)、Qwen2(72B)、Starcoder/Starcoder2、Gemma(7B)、Llava‑v1.6‑Mistral‑7B 與 Phi‑2。

此外,亦支援透過 Intel Neural Compressor (INC) 進行 FP8 量化,以進一步提升效能。

部署與實作

使用者可透過官方 Docker 映像 ghcr.io/huggingface/text-generation-inference:3.2.1-gaudi 在 Gaudi 上部署 TGI。部署時需要具備 Gaudi 硬體的機器,並加入 --runtime=habana 參數。

未來將規劃支援更多模型,包括 DeepSeek‑r1/v3 與 QWen‑VL 等。

Sources