pytorch/TensorRT
PyTorch/TorchScript/FX compiler for NVIDIA GPUs using TensorRT
What it solves
Torch‑TensorRT는 NVIDIA GPU에서 PyTorch 모델의 추론 성능을 가속화하는 방법을 제공합니다. eager execution 모드에서 발생하는 느린 추론 지연 시간 문제를 해결하며, 지연 시간을 최대 5배까지 줄일 수 있습니다.
How it works
NVIDIA의 TensorRT 최적화 엔진을 PyTorch 생태계에 통합합니다. 사용자는 두 가지 주요 방법으로 최적화를 적용할 수 있습니다:
- torch.compile: 백엔드를 "tensorrt"로 설정하는 한 줄 통합으로, 모델이 첫 실행 시 컴파일됩니다.
- Export workflow: 사전 최적화 및 직렬화 프로세스로, Python 의존성 없이 PyTorch 또는 C++ 환경(libtorch)에서 모델을 배포할 수 있습니다.
Who it’s for
NVIDIA 하드웨어에서 PyTorch 모델을 배포하고 추론 속도와 효율성을 극대화해야 하는 개발자 및 ML 엔지니어를 위한 도구입니다.
Highlights
- 고성능 추론 가속( eager execution 대비 최대 5배 빠름).
torch.compile과의 원활한 통합으로 빠른 프로토타이핑 가능.- C++ 배포를 위한 사전 직렬화 지원.
- Diffusion 모델, Hugging Face의 LLM, FP8 정밀도와 호환.
- Linux(AMD64, SBSA)와 Windows(Dynamo 전용)를 아우르는 광범위한 플랫폼 지원.