triton-inference-server/tensorrtllm_backend

The Triton TensorRT-LLM Backend

解決的問題

本專案提供 Triton Inference Server 用的後端,讓使用者能部署以 TensorRT-LLM 優化的大規模語言模型(LLM)。它簡化了高效率 LLM 推論的部署,支援飛行中批次處理與分頁注意力等進階功能,以在 NVIDIA GPU 上最大化吞吐量與效率。

工作原理

此後端將 TensorRT-LLM 整合至 Triton Inference Server 生態系中。可透過以下幾種方式部署:

  • PyTorch 後端(LLM API):無需手動編譯引擎,即可直接部署 HuggingFace 模型。
  • 部署模式:支援「領導者模式」(每張 GPU 一個 Triton 進程,適合 Slurm)與「編排器模式」(一個編排器進程為每張 GPU 啟動工作進程)。
  • 平行處理:實作張量平行、流水線平行與專家平行,以在多張 GPU 或節點之間分散大型模型。
  • 執行:使用 C++ 實作核心批次管理器,以處理飛行中批次處理與請求排程。

適用對象

專為需要在 NVIDIA 硬體上使用 Triton Inference Server 部署 LLM 的機器學習工程師與 DevOps 專業人員設計,特別適合需要高吞吐量、多 GPU 擴展與與 Triton 整合的場景。

主要亮點

  • 進階批次處理:支援飛行中批次處理與分頁注意力。
  • 彈性部署:支援多節點,並與基於 Slurm 的叢集相容。
  • 多樣化解碼:支援 Top-k、Top-p、束搜尋以及推測解碼(Medusa、ReDrafter、Lookahead、Eagle)。
  • 模型支援:相容 LLaMA、Gemma、Mistral 及多種多模態與編碼器-解碼器模型。
  • 優化能力:與量化及 LoRA 整合,提升效能與記憶體效率。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch