NVIDIA/TensorRT-LLM

TensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C++ runtimes that orchestrate the inference execution in a performant way.

解決的問題

TensorRT LLM 旨在優化大型語言模型 (LLM) 與視覺生成模型的推理效能。它解決了部署這些大規模模型時高延遲與低吞吐量的瓶頸,使其能在 NVIDIA GPU 上更快速、更高效地執行。

工作原理

該專案提供了一個用於自訂與擴展系統的 Pythonic 框架,並結合了用於常見 AI 操作的高效能執行階段與專用核心。它採用了多種優化技術,包括:

  • 量化與稀疏性:透過降低模型精度來減少記憶體佔用並提高速度。
  • 投機解碼 (Speculative Decoding):使用較小的模型來預測 Token,再由較大的模型進行驗證,從而提高吞吐量。
  • 進階注意力機制:實現稀疏注意力 (Sparse Attention)、多塊注意力 (Multiblock Attention) 與跳過 Softmax 注意力 (Skip Softmax Attention),以加速長上下文推理。
  • 分散式推理:利用分散式權重數據並行 (DWDP) 與專家並行,在多個 GPU 或機架(例如 NVL72)上擴展推理。

適用對象

面向需要在從 Jetson AGX Orin 到 H200 與 Blackwell GPU 等 NVIDIA 硬體上,為 LLM 與視覺生成模型部署高效能推理伺服器的 AI 開發人員與工程師。

亮點

  • 廣泛的模型支援:針對包括 Llama、DeepSeek、Mixtral 以及用於視覺生成的擴散模型在內的廣泛模型進行了優化。
  • 發揮 NVIDIA 硬體效能:專為 NVIDIA Blackwell、H100、H200 與 Jetson 平台進行了調優。
  • 極致吞吐量:能夠提供海量的每秒 Token 數(例如,在 B200 GPU 上 Llama 4 每秒可處理超過 40,000 個 Token)。
  • 可擴展框架:為開發人員提供 Pythonic 介面以自訂系統。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案