alibaba/RecIS
A unified architecture deep learning framework designed specifically for ultra-large-scale sparse models.
해결하는 문제
RecIS는 초대규모 추천 시스템의 과제, 특히 희소 컴퓨팅과 밀집 컴퓨팅을 통합해야 하는 필요성을 해결하도록 설계되었습니다. 희소 연산자의 메모리 액세스와 관련된 성능 병목 현상과 멀티모달 또는 대규모 모델과 결합된 산업급 추천 모델 학습의 복잡성을 해결합니다.
작동 방식
PyTorch 생태계를 기반으로 구축된 RecIS는 모듈형 아키텍처를 사용하여 학습 파이프라인을 관리합니다:
- ColumnIO: 분산 샤드 데이터 읽기 및 특징 사전 계산을 처리합니다.
- Feature Engine: 오버헤드를 줄이기 위한 연산자 융합(operator fusion)을 통해 특징 엔지니어링(해싱 및 버킷화 등)을 관리합니다.
- Embedding Engine: 더 나은 메모리 액세스를 위한 멀티 테이블 융합을 갖춘 확장 가능하고 충돌 없는 KV 저장소 임베딩 테이블을 관리합니다.
- Saver: 희소 파라미터의 저장 및 로드를 위해 SafeTensors 표준을 사용합니다.
- Pipelines: 다단계 및 다중 목적 계산을 포함한 전체 학습 워크플로우를 조율합니다.
성능 최적화를 위해 동적 임베딩을 위한 2단계 저장 아키텍처(IDMap 및 EmbeddingBlocks)를 구현하고, 분산 파라미터 샤딩 및 요청 병합을 위해 All-to-All 집합 통신을 사용합니다.
대상
희소 특징과 밀집 딥러닝 구성 요소를 결합한 모델의 고성능 학습이 필요한 산업 규모의 추천, 광고 및 검색 시스템 분야의 엔지니어 및 연구자를 대상으로 합니다.
주요 특징
- 통합 프레임워크: PyTorch 생태계 내에서 희소-밀집 컴퓨팅을 통합합니다.
- 고성능: 연산자 융합 및 벡터화된 메모리 액세스를 통해 GPU 활용도를 최적화합니다.
- 동적 임베딩: GPU 또는 CPU에 배치할 수 있는 HashTable 임베딩을 위한 유연한 2단계 저장 시스템을 구현합니다.
- 분산 확장성: 파라미터 집계 및 샤딩을 사용하여 대규모 임베딩 테이블을 컴퓨팅 노드에 분산시킵니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트