triton-inference-server/tensorrtllm_backend

The Triton TensorRT-LLM Backend

何を解決するか

このプロジェクトは、Triton Inference Server用のバックエンドを提供し、TensorRT-LLMで最適化された大規模言語モデル(LLM)を配信できるようにします。高パフォーマンスなLLM推論のデプロイを簡素化し、飛行中バッチ処理やページ化されたアテンションといった高度な機能をサポートすることで、NVIDIA GPU上でスループットと効率を最大化します。

動作方法

このバックエンドは、TensorRT-LLMをTriton Inference Serverエコシステムに統合します。以下の方法でデプロイできます:

  • PyTorchバックエンド(LLM API):手動でのエンジンコンパイルを必要とせず、HuggingFaceモデルを直接配信可能。
  • デプロイモード:"リーダーモード"(GPUごとに1つのTritonプロセス、Slurmに最適)と"オーケストレータモード"(1つのオーケストレータプロセスがGPUごとにワーカーを起動)をサポート。
  • 並列処理:Tensor、パイプライン、エキスパート並列処理を実装し、大規模モデルを複数GPUまたはノードに分散。
  • 実行:飛行中バッチ処理とリクエストスケジューリングを処理するためのC++実装をコアバッチマネージャーとして使用。

対象ユーザー

NVIDIAハードウェアを使用してLLMを本番環境にデプロイする必要がある機械学習エンジニアおよびDevOpsプロフェッショナル向けに設計されています。特に、高スループット、マルチGPUスケーリング、Triton Inference Serverとの統合を必要とするユーザーに適しています。

主な特徴

  • 高度なバッチ処理:飛行中バッチ処理とページ化アテンションをサポート。
  • 柔軟なデプロイ:マルチノード対応およびSlurmベースのクラスタとの互換性。
  • 多様なデコード:Top-k、Top-p、ビームサーチ、および推測的デコード(Medusa、ReDrafter、Lookahead、Eagle)をサポート。
  • モデル対応:LLaMA、Gemma、Mistral、およびさまざまなマルチモーダルおよびエンコーダデコーダモデルに対応。
  • 最適化:量子化およびLoRAとの統合により、パフォーマンスとメモリ効率を向上。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch