duoan/mega-data-factory
🏭 Mega Scale Multimodal DataPipeline for SOTA Foundation Models
해결하는 문제
Mega Data Factory는 웹 규모의 멀티모달 데이터 세트(수천억 개의 레코드)를 처리하도록 설계된 고처리량 분산형 파이프라인입니다. FineWeb, RefinedWeb, LAION-5B와 같은 최첨단 파운데이션 모델 데이터 파이프라인을 재현할 수 있도록 대량의 텍스트, 이미지 및 비디오 데이터를 필터링, 점수 매기기 및 중복 제거하는 표준화된 방법을 제공합니다.
작동 방식
Ray를 기반으로 구축된 이 시스템은 처리를 단계(CPU 및 GPU 풀)로 분리하는 분산 아키텍처를 사용합니다. 데이터 배치가 일련의 "연산자"(refiners, filters, deduplicators)를 통과하는 파이프라인 병렬 설계를 채택했습니다. 성능을 극대화하기 위해 CPU 집약적인 작업에는 Rust 가속 연산자를 사용하고, 임베딩 추출 및 점수 매기기에는 GPU 최적화 연산자를 사용합니다.
대상
다양한 모달리티에 걸친 노이즈가 많은 웹 규모의 원시 데이터에서 고품질 학습 세트를 큐레이션해야 하는 파운데이션 모델 구축 AI 연구자 및 데이터 엔지니어를 위해 설계되었습니다.
주요 특징
- 멀티모달 지원: CLIP/SigLIP 임베딩 추출을 포함하여 텍스트, 이미지 및 비디오를 위한 전용 연산자 제공.
- 고성능: 가속을 위해 Rust를 사용하며, 고처리량 오프라인 LLM 합성을 위해 vLLM 사용.
- 재현 가능한 레시피: RefinedWeb 및 Z-Image와 같은 주요 논문의 특정 필터링 및 점수 매기기 로직 구현.
- LLM 합성: 온라인(계정/프록시 로테이션 기반 API) 및 오프라인(로컬 GPU) 데이터 합성을 모두 통합 지원.
- 포괄적인 보고서: 데이터 흐름을 시각화하기 위한 데이터 품질 퍼널 및 Sankey 다이어그램이 포함된 대화형 HTML 보고서 생성.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트