pytorch/TensorRT
PyTorch/TorchScript/FX compiler for NVIDIA GPUs using TensorRT
解决的问题
Torch-TensorRT 解决了在 NVIDIA GPU 上优化 PyTorch 模型以实现高性能推理的挑战。开发者无需手动将模型重写为 TensorRT,即可将推理延迟降低至标准急切执行(eager execution)的 5 倍。
工作原理
它将 NVIDIA 的 TensorRT 优化引擎直接集成到 PyTorch 生态系统中。用户可以通过以下两种主要方式使用:
- 即时编译:使用
torch.compile并指定tensorrt后端,实现运行时模型优化。 - 提前编译导出:将模型编译并序列化为格式(如 TorchScript),可在 PyTorch 或 C++ 环境中通过 libtorch 部署,从而在生产环境中移除对 Python 的依赖。
适用人群
专为在 NVIDIA 硬件上部署 PyTorch 模型,并需要在生产环境中最大化吞吐量、最小化延迟的机器学习工程师和开发者设计。
主要亮点
- 显著提速:推理延迟最高可加速 5 倍。
- 灵活部署:支持基于 Python 的运行时和 C++ 部署。
- 广泛模型支持:兼容扩散模型、Hugging Face 的 LLM 以及 FP8 精度。
- 无缝集成:通过
torch.compile一行代码即可激活。
相关
- 项目
- 项目
- 项目
- 项目
- 项目