NVIDIA/recsys-examples
Examples for Recommenders - easy to train and deploy on accelerated infrastructure.
해결하는 문제
이 프로젝트는 대규모 추천 시스템을 위한 최적화된 구현과 GPU 가속 컴포넌트를 제공하며, 랭킹 및 검색 모델의 학습 및 추론 시 지연 시간을 줄이고 처리량을 높이는 데 중점을 둡니다.
작동 방식
리포지토리는 고수준 예제와 저수준 GPU 라이브러리로 나뉩니다:
- 예제: 랭킹 및 검색을 위한 HSTU(Hierarchical Sequential Transformer Unit)와 계층적 의미 ID 예측을 사용한 생성형 검색을 위한 SID-GR(Semantic ID Generative Recommender)와 같은 고급 추천 아키텍처를 구현합니다.
- GPU 라이브러리: 모델 병렬 동적 임베딩 테이블을 위한
DynamicEmb(유연한 제거 정책(LRU/LFU) 포함), 사용자 ID 기반 KV 캐시 재사용을 위한RecSys KVCache Manager, 최적화된 비임베딩 검색 디코딩 어텐션 커널을 제공합니다. - 최적화: NVIDIA 전용 하드웨어 가속(Blackwell, SM8x, SM90), Triton Inference Server, CUDA 그래프, AOTInductor를 활용하여 C++ 배포를 지원합니다.
대상 사용자
GPU 활용도를 최적화하고, 거대한 임베딩 테이블을 관리하며, 대규모로 생성형 검색 모델을 배포해야 하는 산업 규모의 추천 시스템을 구축하는 머신러닝 엔지니어 및 연구자입니다.
주요 특징
- 생성형 추천: 최적화된 비임베딩 검색과 KV 캐시 관리를 지원하는 SID-GR 모델.
- C++ 배포: AOTInductor를 사용한 네이티브 C++ 재생을 가능하게 하는 엔드투엔드 HSTU 추론 워크플로우.
- 동적 임베딩 관리: GPU/호스트 해시 테이블 저장소와 복합 제거 정책을 갖춘 고급 임베딩 테이블.
- 고성능 추론: Triton Inference Server 및 페이지화된 GPU KV 캐시와 통합하여 로드/오프로드 지연을 숨깁니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트