NVIDIA/recsys-examples

Examples for Recommenders - easy to train and deploy on accelerated infrastructure.

何を解決するか

このプロジェクトは、大規模なレコメンデーションシステム向けに最適化された実装とGPUアクセラレーションコンポーネントを提供し、ランキングおよびリトリーバルモデルのトレーニングおよび推論におけるレイテンシの低減とスループットの向上に焦点を当てています。

動作方法

リポジトリは高レベルの例と低レベルのGPUライブラリに分かれています:

  • : ランキングおよびリトリーバル向けのHSTU(階層的順序変換ユニット)や、階層的意味ID予測を用いた生成的リトリーバル向けのSID-GR(意味ID生成レコメンデーション)といった高度なレコメンデーションアーキテクチャを実装しています。
  • GPUライブラリ: モデル並列動的埋め込みテーブルをサポートする DynamicEmb(柔軟な削除ポリシー(LRU/LFU)を備える)、ユーザーIDベースのKVキャッシュ再利用を可能にする RecSys KVCache Manager、および最適化されたビームサーチデコードアテンションカーネルを提供します。
  • 最適化: NVIDIA固有のハードウェアアクセラレーション(Blackwell、SM8x、SM90)、Triton Inference Server、CUDAグラフ、およびAOTInductorを活用してC++デプロイを実現します。

対象ユーザー

GPUの利用効率を最適化し、巨大な埋め込みテーブルを管理し、スケールした生成的リトリーバルモデルをデプロイする必要がある、産業規模のレコメンデーションシステムを構築する機械学習エンジニアおよび研究者です。

主な特徴

  • 生成的レコメンデーション: 最適化されたビームサーチとKVキャッシュ管理を備えたSID-GRモデルのサポート。
  • C++デプロイ: AOTInductorを用いたネイティブC++リプレイを可能にするエンドツーエンドのHSTU推論ワークフロー。
  • 動的埋め込み管理: GPU/ホストハッシュテーブルストレージと複合削除ポリシーを備えた高度な埋め込みテーブル。
  • 高性能推論: Triton Inference Serverおよびページ化GPU KVキャッシュとの統合により、ロード/アンロードのレイテンシを隠蔽します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト