NVIDIA/TensorRT-LLM

TensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C++ runtimes that orchestrate the inference execution in a performant way.

解决的问题

TensorRT LLM 旨在优化大语言模型 (LLM) 和视觉生成模型的推理性能。它解决了部署这些大规模模型时高延迟和低吞吐量的瓶颈,使其能够在 NVIDIA GPU 上更快速、更高效地运行。

工作原理

该项目提供了一个用于定制和扩展系统的 Pythonic 框架,并结合了用于常见 AI 操作的高效运行时和专用内核。它采用了多种优化技术,包括:

  • 量化与稀疏性:通过降低模型精度来减少内存占用并提高速度。
  • 投机解码 (Speculative Decoding):使用较小的模型来预测 Token,再由较大的模型进行验证,从而提高吞吐量。
  • 高级注意力机制:实现稀疏注意力 (Sparse Attention)、多块注意力 (Multiblock Attention) 和跳过 Softmax 注意力 (Skip Softmax Attention),以加速长上下文推理。
  • 分布式推理:利用分布式权重数据并行 (DWDP) 和专家并行,在多个 GPU 或机架(例如 NVL72)上扩展推理。

适用对象

面向需要在从 Jetson AGX Orin 到 H200 和 Blackwell GPU 等 NVIDIA 硬件上为 LLM 和视觉生成模型部署高性能推理服务器的 AI 开发人员和工程师。

亮点

  • 广泛的模型支持:针对包括 Llama、DeepSeek、Mixtral 以及用于视觉生成的扩散模型在内的广泛模型进行了优化。
  • 利用 NVIDIA 硬件:专门针对 NVIDIA Blackwell、H100、H200 和 Jetson 平台进行了调优。
  • 极高吞吐量:能够提供海量的每秒 Token 数(例如,在 B200 GPU 上 Llama 4 的每秒处理超过 40,000 个 Token)。
  • 可扩展框架:为开发人员提供 Pythonic 接口以定制系统。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目