pytorch/TensorRT

PyTorch/TorchScript/FX compiler for NVIDIA GPUs using TensorRT

解决的问题

Torch-TensorRT 解决了在 NVIDIA GPU 上优化 PyTorch 模型以实现高性能推理的挑战。开发者无需手动将模型重写为 TensorRT,即可将推理延迟降低至标准急切执行(eager execution)的 5 倍。

工作原理

它将 NVIDIA 的 TensorRT 优化引擎直接集成到 PyTorch 生态系统中。用户可以通过以下两种主要方式使用:

  1. 即时编译:使用 torch.compile 并指定 tensorrt 后端,实现运行时模型优化。
  2. 提前编译导出:将模型编译并序列化为格式(如 TorchScript),可在 PyTorch 或 C++ 环境中通过 libtorch 部署,从而在生产环境中移除对 Python 的依赖。

适用人群

专为在 NVIDIA 硬件上部署 PyTorch 模型,并需要在生产环境中最大化吞吐量、最小化延迟的机器学习工程师和开发者设计。

主要亮点

  • 显著提速:推理延迟最高可加速 5 倍。
  • 灵活部署:支持基于 Python 的运行时和 C++ 部署。
  • 广泛模型支持:兼容扩散模型、Hugging Face 的 LLM 以及 FP8 精度。
  • 无缝集成:通过 torch.compile 一行代码即可激活。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目