Hugging Face Text Generation Inference (TGI) 多后端支持

Hugging Face 为 Text Generation Inference (TGI) 引入了多后端架构,使用户能够在根据硬件和性能需求在不同执行引擎之间切换的同时,使用单一统一的前端部署大型语言模型(LLM)。此更新通过允许 TGI 作为一个集成多个专用后端的层来解决推理生态系统的碎片化问题。

多样化推理引擎的统一前端

TGI 现在支持一种模块化架构,使其能够与各种推理解决方案集成。这种方法消除了用户手动配置单独后端、管理不同许可证或在切换引擎时重新构建基础设施的需求。通过提供一致的用户体验,TGI 使开发者能够在不更改其主要部署接口的情况下,为特定模型或硬件优化性能。

技术架构:Rust Backend Trait

TGI 由 Rust 和 Python 的组合构建。系统利用 Rust 来处理 HTTP 和调度层,以通过绕过 Python 全局解释器锁(GIL)来确保内存安全、静态分析和高并发。

为了实现多后端支持,TGI 团队实现了一个新的 Rust trait Backend。此接口将 HTTP 服务器与调度器解耦,创建了一个可以将传入请求路由到不同建模和执行引擎的模块化系统。此 trait 作为将新推理后端集成到 TGI 生态系统的基础机制。

2025 后端路线图

Hugging Face 正在与多家合作伙伴合作,在 2025 年全年将各种专用后端集成到 TGI 中:

  • NVIDIA TensorRT-LLM: 与 NVIDIA 合作,以在 NVIDIA GPU 上带来优化性能,并与 optimum-nvidia 集成,用于量化、构建和评估 TensorRT 兼容的制品。
  • vLLM: 计划在 2025 年第一季度将 vLLM 作为 TGI 后端进行集成。
  • Llama.cpp: 与 llama.cpp 团队合作,为 Intel、AMD 和 ARM CPU 服务器提供强大的基于 CPU 的部署选项。
  • AWS Neuron: 与 AWS 合作,以启用对 Inferentia 2 和 Trainium 2 的原生支持。
  • Google TPU: 与 Google Jetstream 和 TPU 团队合作以优化性能。

这些后端功能将直接集成到 Hugging Face Inference Endpoints 中,使用户能够在各种硬件上以高可靠性和开箱即用的性能部署模型。

Sources