NVIDIA/recsys-examples

Examples for Recommenders - easy to train and deploy on accelerated infrastructure.

解决的问题

该项目为大规模推荐系统提供优化的实现和GPU加速组件,专注于降低排名和检索模型在训练和推理过程中的延迟,并提高吞吐量。

工作原理

仓库分为高层级示例和低层级GPU库:

  • 示例:实现先进的推荐架构,如用于排名和检索的HSTU(分层序列Transformer单元),以及使用分层语义ID预测的生成式检索SID-GR(语义ID生成推荐器)。
  • GPU库:提供专用基础设施,如 DynamicEmb(支持灵活淘汰策略(LRU/LFU)的模型并行动态嵌入表)、基于用户ID的KV缓存复用的 RecSys KVCache Manager,以及优化的束搜索解码注意力内核。
  • 优化:利用NVIDIA专用硬件加速(Blackwell、SM8x、SM90)、Triton Inference Server、CUDA图和AOTInductor实现C++部署。

适用人群

需要优化GPU利用率、管理超大规模嵌入表,并在大规模场景下部署生成式检索模型的机器学习工程师和研究人员。

主要亮点

  • 生成式推荐:支持SID-GR模型,具备优化的束搜索和KV缓存管理。
  • C++部署:使用AOTInductor实现端到端HSTU推理工作流,支持原生C++重放。
  • 动态嵌入管理:支持GPU/主机哈希表存储的高级嵌入表,具备复合淘汰策略。
  • 高性能推理:与Triton Inference Server和分页GPU KV缓存集成,隐藏加载/卸载延迟。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目