文本生成推理 (TGI) Intel Gaudi 集成
Hugging Face 已在 Text Generation Inference (TGI) 中原生集成了 Intel Gaudi 硬件支持,使得能够在 Intel 专用 AI 加速器上部署大语言模型(LLM),并使用生产就绪的服务栈。此集成消除了对单独 fork 的需求,并让 Gaudi 用户能够立即使用最新的 TGI 功能。
统一后端架构
TGI 现在在其主代码库中直接支持 Intel Gaudi(通过 PR #3091),取代了之前需要使用单独 tgi-gaudi fork 的要求。此转变得益于全新的 TGI 多后端架构,简化了用户体验,并确保 Gaudi 硬件在 TGI 生态系统中被视为一等公民。
支持的 Intel Gaudi 硬件
此集成支持全系列的 Intel Gaudi 加速器,包括:
- Gaudi1:可通过 AWS EC2 DL1 实例获取。
- Gaudi2:可通过 Intel Tiber AI Cloud 和 Denvr Dataworks 获取。
- Gaudi3:可通过 Intel Tiber AI Cloud、IBM Cloud,以及包括 Dell、HP、Supermicro 在内的 OEM 获取。
关键能力与生产优势
Gaudi 后端将 TGI 的生产级特性带到 Intel 硬件上,提供了传统 GPU 部署的替代方案。关键优势包括:
- Production-Ready Features:支持动态批处理和流式响应。
- Deployment Flexibility:提升硬件多样性,并为特定工作负载提供具有竞争力的性价比。
- Advanced Technical Support:支持多卡推理(分片)、视觉语言模型以及 FP8 精度。
优化的模型支持
Hugging Face 已针对 Intel Gaudi 硬件专门优化了建模代码,以在单卡和多卡配置下实现最佳性能。目前已针对 Gaudi 优化的模型包括:
- Llama Series:Llama 3.1(8B 和 70B)、Llama 3.3(70B)以及 Llama 3.2 Vision(11B)。
- Mistral/Mixtral:Mistral(7B)和 Mixtral(8x7B)。
- Other Architectures:CodeLlama(13B)、Falcon(180B)、Qwen2(72B)、Starcoder/Starcoder2、Gemma(7B)、Llava-v1.6-Mistral-7B 和 Phi-2。
此外,还通过 Intel Neural Compressor (INC) 支持 FP8 量化,以进一步提升性能。
部署与实现
用户可以使用官方 Docker 镜像(ghcr.io/huggingface/text-generation-inference:3.2.1-gaudi)在 Gaudi 上部署 TGI。部署需要配备 Gaudi 硬件的机器,并使用 --runtime=habana 标志。
未来的更新计划加入对更多模型的支持,包括 DeepSeek-r1/v3 和 QWen-VL。