NVIDIA/recsys-examples
Examples for Recommenders - easy to train and deploy on accelerated infrastructure.
何を解決するか
このプロジェクトは、大規模なレコメンデーションシステム向けに最適化された実装とGPUアクセラレーションコンポーネントを提供し、ランキングおよびリトリーバルモデルのトレーニングおよび推論におけるレイテンシの低減とスループットの向上に焦点を当てています。
動作方法
リポジトリは高レベルの例と低レベルのGPUライブラリに分かれています:
- 例: ランキングおよびリトリーバル向けのHSTU(階層的順序変換ユニット)や、階層的意味ID予測を用いた生成的リトリーバル向けのSID-GR(意味ID生成レコメンデーション)といった高度なレコメンデーションアーキテクチャを実装しています。
- GPUライブラリ: モデル並列動的埋め込みテーブルをサポートする
DynamicEmb(柔軟な削除ポリシー(LRU/LFU)を備える)、ユーザーIDベースのKVキャッシュ再利用を可能にするRecSys KVCache Manager、および最適化されたビームサーチデコードアテンションカーネルを提供します。 - 最適化: NVIDIA固有のハードウェアアクセラレーション(Blackwell、SM8x、SM90)、Triton Inference Server、CUDAグラフ、およびAOTInductorを活用してC++デプロイを実現します。
対象ユーザー
GPUの利用効率を最適化し、巨大な埋め込みテーブルを管理し、スケールした生成的リトリーバルモデルをデプロイする必要がある、産業規模のレコメンデーションシステムを構築する機械学習エンジニアおよび研究者です。
主な特徴
- 生成的レコメンデーション: 最適化されたビームサーチとKVキャッシュ管理を備えたSID-GRモデルのサポート。
- C++デプロイ: AOTInductorを用いたネイティブC++リプレイを可能にするエンドツーエンドのHSTU推論ワークフロー。
- 動的埋め込み管理: GPU/ホストハッシュテーブルストレージと複合削除ポリシーを備えた高度な埋め込みテーブル。
- 高性能推論: Triton Inference Serverおよびページ化GPU KVキャッシュとの統合により、ロード/アンロードのレイテンシを隠蔽します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト