NVIDIA/TensorRT-LLM
TensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C++ runtimes that orchestrate the inference execution in a performant way.
解決する課題
TensorRT LLMは、大規模言語モデル(LLM)および視覚生成モデルの推論パフォーマンスを最適化するように設計されています。これらの巨大なモデルのデプロイ時における高レイテンシと低スループットというボトルネックを解消し、NVIDIA GPU上でより高速かつ効率的な実行を可能にします。
仕組み
このプロジェクトは、システムのカスタマイズと拡張のためのPythonicなフレームワークを提供し、一般的なAI演算用の効率的なランタイムと特化型カーネルを組み合わせています。以下を含む様々な最適化技術を採用しています:
- 量子化とスパース性: モデルの精度を下げてメモリ使用量を削減し、速度を向上させます。
- 投機的デコーディング (Speculative Decoding): 小規模なモデルを使用してトークンを予測し、大規模なモデルで検証することでスループットを向上させます。
- 高度なアテンションメカニズム: スパースアテンション、マルチブロックアテンション、および skip softmax attention を実装し、長文コンテキストの推論を加速させます。
- 分散推論: 分散重みデータ並列性 (DWDP) とエキスパート並列性を利用して、複数のGPUまたはラック(例:NVL72)にわたって推論をスケールさせます。
対象ユーザー
Jetson AGX OrinからH200、Blackwell GPUに至るNVIDIAハードウェア上で、LLMおよび視覚生成モデル用の高性能推論サーバーをデプロイする必要があるAI開発者およびエンジニアを対象としています。
ハイライト
- 幅広いモデルサポート: Llama、DeepSeek、Mixtral、および視覚生成用の拡散モデルを含む幅広いモデルに最適化されています。
- NVIDIAハードウェアの活用: NVIDIA Blackwell、H100、H200、およびJetsonプラットフォーム向けに特別にチューニングされています。
- 極限のスループット: 膨大なトークン/秒のレートを実現可能です(例:B200 GPU上のLlama 4で毎秒40,000トークン以上)。
- 拡張可能なフレームワーク: 開発者がシステムをカスタマイズできるようにPythonicなインターフェースを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト