NVIDIA/recsys-examples

Examples for Recommenders - easy to train and deploy on accelerated infrastructure.

해결하는 문제

이 프로젝트는 대규모 추천 시스템을 위한 최적화된 구현과 GPU 가속 컴포넌트를 제공하며, 랭킹 및 검색 모델의 학습 및 추론 시 지연 시간을 줄이고 처리량을 높이는 데 중점을 둡니다.

작동 방식

리포지토리는 고수준 예제와 저수준 GPU 라이브러리로 나뉩니다:

  • 예제: 랭킹 및 검색을 위한 HSTU(Hierarchical Sequential Transformer Unit)와 계층적 의미 ID 예측을 사용한 생성형 검색을 위한 SID-GR(Semantic ID Generative Recommender)와 같은 고급 추천 아키텍처를 구현합니다.
  • GPU 라이브러리: 모델 병렬 동적 임베딩 테이블을 위한 DynamicEmb (유연한 제거 정책(LRU/LFU) 포함), 사용자 ID 기반 KV 캐시 재사용을 위한 RecSys KVCache Manager, 최적화된 비임베딩 검색 디코딩 어텐션 커널을 제공합니다.
  • 최적화: NVIDIA 전용 하드웨어 가속(Blackwell, SM8x, SM90), Triton Inference Server, CUDA 그래프, AOTInductor를 활용하여 C++ 배포를 지원합니다.

대상 사용자

GPU 활용도를 최적화하고, 거대한 임베딩 테이블을 관리하며, 대규모로 생성형 검색 모델을 배포해야 하는 산업 규모의 추천 시스템을 구축하는 머신러닝 엔지니어 및 연구자입니다.

주요 특징

  • 생성형 추천: 최적화된 비임베딩 검색과 KV 캐시 관리를 지원하는 SID-GR 모델.
  • C++ 배포: AOTInductor를 사용한 네이티브 C++ 재생을 가능하게 하는 엔드투엔드 HSTU 추론 워크플로우.
  • 동적 임베딩 관리: GPU/호스트 해시 테이블 저장소와 복합 제거 정책을 갖춘 고급 임베딩 테이블.
  • 고성능 추론: Triton Inference Server 및 페이지화된 GPU KV 캐시와 통합하여 로드/오프로드 지연을 숨깁니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트