pytorch/TensorRT
PyTorch/TorchScript/FX compiler for NVIDIA GPUs using TensorRT
何を解決するか
Torch-TensorRTは、NVIDIA GPU上で高パフォーマンスな推論を最適化する際の課題に対処します。開発者は、TensorRTでモデルを手動で書き直す必要なく、標準的な eager 実行と比較して最大5倍の推論遅延の短縮が可能になります。
動作方法
NVIDIAのTensorRT最適化エンジンをPyTorchエコシステムに直接統合しています。ユーザーは以下の2つの主な方法で利用できます:
- ジャストインタイムコンパイル:
torch.compileにtensorrtバックエンドを使用して、実行時にモデルを最適化します。 - アヘッドオブタイムエクスポート:モデルをコンパイル・シリアル化し、TorchScriptなどの形式に変換することで、PyTorchまたはC++環境(libtorch経由)でデプロイ可能にします。これにより、本番環境でのPython依存を排除できます。
対象ユーザー
NVIDIAハードウェア上でPyTorchモデルをデプロイする機械学習エンジニアや開発者向けです。本番環境でスループットを最大化し、遅延を最小限に抑える必要がある方々に最適です。
主な特徴
- 大幅な高速化:推論遅延を最大5倍まで高速化。
- 柔軟なデプロイ:Pythonベースの実行環境とC++でのデプロイをサポート。
- 広範なモデル対応:Diffusionモデル、Hugging FaceのLLM、FP8精度に対応。
- シームレスな統合:
torch.compileを1行で有効化可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト