pytorch/TensorRT

PyTorch/TorchScript/FX compiler for NVIDIA GPUs using TensorRT

What it solves

Torch‑TensorRT は、NVIDIA GPU 上で PyTorch モデルの推論性能を加速する手段を提供します。eager execution モードでの遅い推論レイテンシという問題に対処し、レイテンシを最大で 5 倍削減できる可能性があります。

How it works

NVIDIA の TensorRT 最適化エンジンを PyTorch エコシステムに統合します。ユーザーは主に 2 つの方法で最適化を適用できます:

  1. torch.compile:バックエンドを "tensorrt" に設定するだけのワンライン統合で、初回実行時にモデルがコンパイルされます。
  2. Export workflow:事前最適化とシリアライズのプロセスで、Python 依存なしに PyTorch または C++ 環境(libtorch 経由)でモデルをデプロイできます。

Who it’s for

NVIDIA ハードウェア上で PyTorch モデルをデプロイし、推論速度と効率を最大化したい開発者や機械学習エンジニア向けです。

Highlights

  • 高性能推論アクセラレーション(eager execution より最大 5 倍高速)。
  • torch.compile とのシームレスな統合で迅速なプロトタイピングが可能。
  • C++ デプロイ用の事前シリアライズをサポート。
  • Diffusion モデル、Hugging Face の LLM、FP8 精度に対応。
  • Linux(AMD64、SBSA)および Windows(Dynamo のみ)に跨る広範なプラットフォームサポート。