NVIDIA/recsys-examples

Examples for Recommenders - easy to train and deploy on accelerated infrastructure.

解決的問題

本專案提供大規模推薦系統的優化實作與GPU加速元件,專注於降低排名與檢索模型在訓練與推論過程中的延遲,並提升吞吐量。

工作原理

倉儲分為高階示例與低階GPU函式庫:

  • 示例:實作先進的推薦架構,如用於排名與檢索的HSTU(分層序列Transformer單元),以及使用分層語意ID預測的生成式檢索SID-GR(語意ID生成推薦器)。
  • GPU函式庫:提供專用基礎設施,如 DynamicEmb(支援靈活淘汰策略(LRU/LFU)的模型平行動態嵌入表)、基於使用者ID的KV快取重用的 RecSys KVCache Manager,以及優化的束搜尋解碼注意力核心。
  • 優化:利用NVIDIA專用硬體加速(Blackwell、SM8x、SM90)、Triton Inference Server、CUDA圖與AOTInductor實現C++部署。

適用對象

需要優化GPU使用率、管理超大規模嵌入表,並在大規模場景下部署生成式檢索模型的機器學習工程師與研究人員。

主要亮點

  • 生成式推薦:支援SID-GR模型,具備優化的束搜尋與KV快取管理。
  • C++部署:使用AOTInductor實現端對端HSTU推論工作流程,支援原生C++重播。
  • 動態嵌入管理:支援GPU/主機雜湊表儲存的高階嵌入表,具備複合淘汰策略。
  • 高效率推論:與Triton Inference Server及分頁GPU KV快取整合,隱藏載入/卸載延遲。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案