triton-inference-server/tensorrtllm_backend

The Triton TensorRT-LLM Backend

解决的问题

该项目为 Triton Inference Server 提供了一个后端,使用户能够部署使用 TensorRT-LLM 优化的大规模语言模型(LLM)。它简化了高性能 LLM 推理的部署,支持飞行中批处理和分页注意力等高级功能,以在 NVIDIA GPU 上最大化吞吐量和效率。

工作原理

该后端将 TensorRT-LLM 集成到 Triton Inference Server 生态系统中。可通过以下几种方式部署:

  • PyTorch 后端(LLM API):无需手动编译引擎,即可直接部署 HuggingFace 模型。
  • 部署模式:支持「领导者模式」(每个 GPU 一个 Triton 进程,适合 Slurm)和「编排器模式」(一个编排器进程为每个 GPU 启动工作进程)。
  • 并行性:实现张量并行、流水线并行和专家并行,以在多个 GPU 或节点之间分布大型模型。
  • 执行:使用 C++ 实现核心批处理管理器,以处理飞行中批处理和请求调度。

适用人群

专为需要在 NVIDIA 硬件上使用 Triton Inference Server 部署 LLM 的机器学习工程师和 DevOps 专业人员设计,尤其适用于需要高吞吐量、多 GPU 扩展和与 Triton 集成的场景。

主要亮点

  • 高级批处理:支持飞行中批处理和分页注意力。
  • 灵活部署:支持多节点,并与基于 Slurm 的集群兼容。
  • 多样解码:支持 Top-k、Top-p、束搜索以及推测解码(Medusa、ReDrafter、Lookahead、Eagle)。
  • 模型支持:兼容 LLaMA、Gemma、Mistral 以及多种多模态和编码器-解码器模型。
  • 优化能力:与量化和 LoRA 集成,提升性能和内存效率。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch