triton-inference-server/tensorrtllm_backend
The Triton TensorRT-LLM Backend
何を解決するか
このプロジェクトは、Triton Inference Server用のバックエンドを提供し、TensorRT-LLMで最適化された大規模言語モデル(LLM)を配信できるようにします。高パフォーマンスなLLM推論のデプロイを簡素化し、飛行中バッチ処理やページ化されたアテンションといった高度な機能をサポートすることで、NVIDIA GPU上でスループットと効率を最大化します。
動作方法
このバックエンドは、TensorRT-LLMをTriton Inference Serverエコシステムに統合します。以下の方法でデプロイできます:
- PyTorchバックエンド(LLM API):手動でのエンジンコンパイルを必要とせず、HuggingFaceモデルを直接配信可能。
- デプロイモード:"リーダーモード"(GPUごとに1つのTritonプロセス、Slurmに最適)と"オーケストレータモード"(1つのオーケストレータプロセスがGPUごとにワーカーを起動)をサポート。
- 並列処理:Tensor、パイプライン、エキスパート並列処理を実装し、大規模モデルを複数GPUまたはノードに分散。
- 実行:飛行中バッチ処理とリクエストスケジューリングを処理するためのC++実装をコアバッチマネージャーとして使用。
対象ユーザー
NVIDIAハードウェアを使用してLLMを本番環境にデプロイする必要がある機械学習エンジニアおよびDevOpsプロフェッショナル向けに設計されています。特に、高スループット、マルチGPUスケーリング、Triton Inference Serverとの統合を必要とするユーザーに適しています。
主な特徴
- 高度なバッチ処理:飛行中バッチ処理とページ化アテンションをサポート。
- 柔軟なデプロイ:マルチノード対応およびSlurmベースのクラスタとの互換性。
- 多様なデコード:Top-k、Top-p、ビームサーチ、および推測的デコード(Medusa、ReDrafter、Lookahead、Eagle)をサポート。
- モデル対応:LLaMA、Gemma、Mistral、およびさまざまなマルチモーダルおよびエンコーダデコーダモデルに対応。
- 最適化:量子化およびLoRAとの統合により、パフォーマンスとメモリ効率を向上。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch