pytorch/TensorRT
PyTorch/TorchScript/FX compiler for NVIDIA GPUs using TensorRT
解決的問題
Torch-TensorRT 解決了在 NVIDIA GPU 上優化 PyTorch 模型以實現高效率推論的挑戰。開發者無需手動將模型重寫為 TensorRT,即可將推論延遲降低至標準急切執行(eager execution)的 5 倍。
工作原理
它將 NVIDIA 的 TensorRT 最佳化引擎直接整合至 PyTorch 生態系統中。使用者可透過以下兩種主要方式使用:
- 即時編譯:使用
torch.compile並指定tensorrt後端,於執行時優化模型。 - 提前編譯匯出:將模型編譯並序列化為格式(如 TorchScript),可在 PyTorch 或 C++ 環境中透過 libtorch 部署,從而於生產環境中移除對 Python 的依賴。
適用對象
專為在 NVIDIA 硬體上部署 PyTorch 模型,並需在生產環境中最大化吞吐量、最小化延遲的機器學習工程師與開發者設計。
主要亮點
- 顯著提速:推論延遲最高可加速 5 倍。
- 彈性部署:支援基於 Python 的執行環境與 C++ 部署。
- 廣泛模型支援:相容擴散模型、Hugging Face 的 LLM 與 FP8 精度。
- 無縫整合:透過
torch.compile一行程式碼即可啟用。
相關
- 專案
- 專案
- 專案
- 專案
- 專案