NVIDIA-NeMo/Curator
Scalable data pre processing and curation toolkit for LLMs
해결하는 문제
NeMo Curator는 AI 학습을 위한 대규모 데이터 세트 준비 문제를 해결합니다. 임시 스크립트와 노트북을 대체하여, 멀티 노드 클러스터에서 수조 개의 토큰 또는 방대한 양의 멀티모달 데이터(텍스트, 이미지, 비디오 및 오디오)를 처리할 수 있는 반복 가능한 GPU 가속 파이프라인을 제공합니다.
작동 방식
이 시스템은 stages 및 executors를 기반으로 하는 모듈형 아키텍처를 사용합니다. 각 스테이지는 데이터 로드, 필터링, 중복 제거 또는 변환과 같은 특정 작업을 수행하고 자체 리소스 요구 사항을 선언합니다. 이러한 스테이지는 파이프라인으로 연결되어 작업을 병렬로 스트리밍하며, CPU와 GPU 작업을 중첩시켜 하드웨어 활용도를 극대화합니다. 기본 프로덕션 설정은 XennaExecutor이지만, Ray 기반 백엔드도 지원됩니다. NVIDIA RAPIDS (cuDF, cuML, cuGraph)를 활용하여 높은 처리량을 달성하고 GPU 전반에 걸쳐 확장할 수 있습니다.
대상 사용자
대규모 AI 모델 학습을 위한 프로덕션급 데이터 큐레이션 파이프라인을 구축해야 하는 ML 엔지니어 및 데이터 팀, 특히 Nemotron과 같은 NVIDIA 학습 워크플로우를 사용하는 팀을 위해 설계되었습니다.
주요 특징
- 멀티모달 지원: 텍스트(중복 제거, 분류), 이미지(미적/NSFW 필터링), 비디오(장면 탐지, 클립 추출), 오디오(ASR 전사, 품질 평가)를 위한 준비된 빌딩 블록.
- GPU 가속: 퍼지 중복 제거와 같은 데이터 집약적 작업에서 CPU 기반 대안에 비해 상당한 속도 향상을 제공합니다.
- 분산 실행: 단일 노트북 또는 멀티 노드 Ray 또는 Slurm 클러스터에서 동일한 파이프라인을 실행할 수 있는 능력.
- 통합 추론: 파이프라인 내에서 합성 데이터 생성(SDG) 및 분류를 위한 OpenAI 호환 LLM 엔드포인트를 포함합니다.
- 대규모 검증 완료: 8조 개 이상의 토큰을 처리하며 NVIDIA Nemotron 모델의 데이터 파이프라인을 구동합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트