Hugging Face Text Generation Inference (TGI) 多後端支援

Hugging Face 已為 Text Generation Inference (TGI) 引入多後端架構,使用單一統一前端使用戶能夠根據硬體與效能需求在不同執行引擎之間切換,以部署大型語言模型(LLM)。此更新透過允許 TGI 作為整合多個專用後端的層來解決推論生態系統的碎片化。

多樣化推論引擎的統一前端

TGI 現在支援模組化架構,使其能夠與各種推論解決方案整合。此方法免除了使用者手動設定獨立後端、管理不同授權或在切換引擎時重建基礎設施的需求。透過提供一致的使用者體驗,TGI 使開發者能夠在不變更主要部署介面的情況下,針對特定模型或硬體優化效能。

技術架構:Rust Backend Trait

TGI 使用 Rust 與 Python 的組合建構。系統利用 Rust 來處理 HTTP 和排程層,以確保記憶體安全、靜態分析以及高併發,方法是繞過 Python 全域解譯器鎖(GIL)。

為了啟用多後端支援,TGI 團隊實作了一個新的 Rust trait Backend。此介面將 HTTP 伺服器與排程器解耦,創建一個可將傳入請求路由至不同建模和執行引擎的模組化系統。此 trait 作為將新推論後端整合到 TGI 生態系統的基礎機制。

2025 後端路線圖

Hugging Face 正與多家合作夥伴合作,在 2025 年期間將多種專用後端整合到 TGI 中:

  • NVIDIA TensorRT-LLM: 與 NVIDIA 合作,透過 optimum-nvidia 進行量化、建置與評估 TensorRT 相容構件,以在 NVIDIA GPU 上帶來最佳化效能。
  • vLLM: 計畫在 2025 年第一季 (Q1 2025) 將 vLLM 作為 TGI 後端進行整合。
  • Llama.cpp: 與 llama.cpp 團隊合作,為 Intel、AMD 與 ARM CPU 伺服器提供穩健的 CPU 基礎部署選項。
  • AWS Neuron: 與 AWS 合作,啟用 Inferentia 2 與 Trainium 2 的原生支援。
  • Google TPU: 與 Google Jetstream 與 TPU 團隊合作,以最佳化效能。

這些後端功能將直接整合到 Hugging Face Inference Endpoints 中,讓使用者能夠在各種硬體上以高可靠性和即插即用的效能部署模型。

Sources