NVIDIA-NeMo/Curator
Scalable data pre processing and curation toolkit for LLMs
What it solves
NeMo Curator는 AI 학습을 위한 방대한 데이터셋 준비 문제를 해결합니다. 임시 스크립트와 노트북을 대체하여 반복 가능한 GPU 가속 파이프라인을 제공함으로써 수조 개 토큰 또는 대규모 멀티모달 데이터를 처리하고, 데이터 정제, 중복 제거, 필터링에 소요되는 시간과 비용을 크게 줄입니다.
How it works
시스템은 stages와 executors 기반의 모듈식 아키텍처를 사용합니다. 각 단계는 로드, 필터링, 변환 등 특정 작업을 수행하고 자체 리소스 요구사항을 선언합니다. 이러한 단계들은 파이프라인으로 연결되어 XennaExecutor 또는 Ray 기반 백엔드와 같은 플러그인 가능한 실행기(executor)를 통해 작업을 스트리밍합니다. 이 스트리밍 방식은 CPU와 GPU 작업을 겹치게 하여, NVIDIA RAPIDS를 활용한 다중 노드·다중 GPU 환경에서도 GPU 워커의 활용도를 높게 유지합니다.
Who it’s for
텍스트, 이미지, 비디오, 오디오 데이터셋에 대해 확장 가능하고 프로덕션 수준의 데이터 큐레이션 파이프라인을 구축해야 하는 ML 엔지니어와 데이터 팀을 위해 설계되었습니다.
Highlights
- Multimodal Support: 텍스트(중복 제거, 언어 감지), 이미지(미학 필터링, NSFW 감지), 비디오(씬 감지, 모션 필터링), 오디오(ASR 전사, WER 필터링)를 위한 즉시 사용 가능한 빌딩 블록.
- GPU Acceleration: NVIDIA RAPIDS와 Ray를 활용해 CPU 기반 대비 16배 빠른 퍼지 중복 제거 등 대규모 속도 향상을 제공합니다.
- Proven at Scale: NVIDIA Nemotron 모델용 데이터 파이프라인을 지원하며, 8조 토큰 이상의 다국어 웹 데이터를 큐레이션한 실적이 있습니다.
- Flexible Deployment: Docker, Slurm, Kubernetes 등을 통해 노트북부터 다중 노드 클러스터까지 다양한 환경에서 실행할 수 있습니다.