pytorch/TensorRT
PyTorch/TorchScript/FX compiler for NVIDIA GPUs using TensorRT
What it solves
Torch-TensorRT 提供了一種在 NVIDIA GPU 上加速 PyTorch 模型推論效能的方法。它解決了 eager execution 模式下推論延遲緩慢的問題,最高可將延遲降低 5 倍。
How it works
它將 NVIDIA 的 TensorRT 最佳化引擎整合到 PyTorch 生態系統中。使用者可以透過兩種主要方式套用最佳化:
- torch.compile:只需一行程式碼,將後端設為 "tensorrt",模型會在第一次執行時即被編譯。
- Export workflow:提前最佳化與序列化的流程,允許模型部署於 PyTorch 或 C++ 環境(透過 libtorch),且不需要 Python 相依。
Who it’s for
在 NVIDIA 硬體上部署 PyTorch 模型,且需要最大化推論速度與效率的開發者與機器學習工程師。
Highlights
- 高效能推論加速(比 eager execution 快最高 5 倍)。
- 與
torch.compile無縫整合,快速原型開發。 - 支援提前序列化以供 C++ 部署。
- 相容於 Diffusion 模型、Hugging Face 的 LLM,以及 FP8 精度。
- 跨平台支援 Linux(AMD64、SBSA)與 Windows(僅 Dynamo)。