datajuicer/data-juicer

Data processing for and with foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

해결하는 문제

Data-Juicer는 원시적이고 혼란스러운 데이터를 고품질의 AI 지원 데이터셋으로 변환하도록 설계된 종합 데이터 처리 시스템입니다. 기반 모델을 위한 대규모 데이터 준비 과정의 문제, 즉 여러 모달리티(텍스트, 이미지, 오디오, 비디오)에 걸친 정제, 중복 제거 및 합성 문제를 해결합니다.

작동 방식

이 시스템은 데이터 처리를 구성 가능한 인프라로 취급합니다. 200개 이상의 연산자를 갖춘 모듈형 아키텍처를 사용하며, 이러한 연산자들은 YAML 레시피로 정의된 재현 가능한 파이프라인으로 연결될 수 있습니다. 이러한 파이프라인은 분산 실행을 위해 Ray를 사용하여 단일 랩톱에서 천 개 노드의 클러스터까지 확장할 수 있으며, 페타바이트 규모의 데이터셋을 처리하기 위한 자동 연산자 융합 및 CUDA 가속과 같은 최적화 기능을 갖추고 있습니다.

대상 사용자

사전 훈련 코퍼스를 큐레이션하고, 파인튜닝 또는 RL 데이터를 준비하고, 에이전트 상호작용 추적을 정제하거나 도메인 특화 RAG 인덱스를 구축해야 하는 AI 연구원 및 엔지니어를 위해 구축되었습니다.

주요 특징

  • 멀티모달 지원: 텍스트, 이미지, 오디오, 비디오 및 embodied AI (VLA) 데이터를 위한 연산자.
  • 레시피 우선 워크플로: 버전 관리 및 공유가 가능한 YAML 기반의 재현 가능한 파이프라인.
  • 클라우드 네이티브 스케일링: 수십억 개의 샘플에 대한 고성능 분산 처리를 위한 Ray와의 깊은 통합.
  • 방대한 연산자 라이브러리: 필터링, 매핑 및 분석을 위한 200개 이상의 내장 연산자.
  • Juicer 모델: 정제 및 라벨링을 위해 자연어 지시를 따르는 로컬 배포 가능한 데이터 정제 모델.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트