pytorch/TensorRT

PyTorch/TorchScript/FX compiler for NVIDIA GPUs using TensorRT

What it solves

Torch-TensorRT 提供了一種在 NVIDIA GPU 上加速 PyTorch 模型推論效能的方法。它解決了 eager execution 模式下推論延遲緩慢的問題,最高可將延遲降低 5 倍。

How it works

它將 NVIDIA 的 TensorRT 最佳化引擎整合到 PyTorch 生態系統中。使用者可以透過兩種主要方式套用最佳化:

  1. torch.compile:只需一行程式碼,將後端設為 "tensorrt",模型會在第一次執行時即被編譯。
  2. Export workflow:提前最佳化與序列化的流程,允許模型部署於 PyTorch 或 C++ 環境(透過 libtorch),且不需要 Python 相依。

Who it’s for

在 NVIDIA 硬體上部署 PyTorch 模型,且需要最大化推論速度與效率的開發者與機器學習工程師。

Highlights

  • 高效能推論加速(比 eager execution 快最高 5 倍)。
  • torch.compile 無縫整合,快速原型開發。
  • 支援提前序列化以供 C++ 部署。
  • 相容於 Diffusion 模型、Hugging Face 的 LLM,以及 FP8 精度。
  • 跨平台支援 Linux(AMD64、SBSA)與 Windows(僅 Dynamo)。