datajuicer/data-juicer

Data processing for and with foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

해결하는 문제

Data-Juicer는 파운데이션 모델을 위한 데이터셋을 준비할 때 발생하는 "원시 데이터의 혼란" 문제를 해결합니다. 무질서하고 정리되지 않은 데이터를 사전 학습, 미세 조정(fine-tuning) 및 RAG 애플리케이션을 위한 고품질의 AI 준비형 인텔리전스로 변환할 수 있는 확장 가능하고 구성 가능한 인프라를 제공합니다.

작동 방식

이 시스템은 200개 이상의 연산자(operator)로 구성된 모듈형 아키텍처를 사용하여 YAML로 정의된 재현 가능한 파이프라인(레시피)으로 체인화할 수 있습니다. 텍스트, 이미지, 오디오, 비디오 및 멀티모달 데이터를 포함한 다양한 데이터 모달리티를 지원합니다. 대규모 워크로드의 경우 Ray와 같은 분산 실행 프레임워크를 활용하여 수천 개의 코어에 걸쳐 방대한 데이터셋을 처리합니다.

대상 사용자

  • AI 연구자: 고품질의 사전 학습 또는 미세 조정 코퍼스가 필요한 파운데이션 모델 구축자.
  • 머신러닝 엔지니어: 상호작용 트레이스를 정제하거나 컨텍스트를 구조화해야 하는 에이전트 시스템 또는 RAG 파이프라인 개발자.
  • 데이터 사이언티스트: 카메라 캘리브레이션 또는 포즈 추정과 같은 전문적인 처리가 필요한 멀티모달 데이터(비디오, 오디오 등) 작업자.

주요 특징

  • 모듈형 아키텍처: 텍스트, 이미지, 오디오, 비디오 및 멀티모달 데이터를 위한 200개 이상의 연산자.
  • 확장 가능한 성능: 6400코어 클러스터에서 2시간 만에 700억 개의 샘플 처리 가능.
  • 레시피 기반: 버전 관리 및 공유가 가능한 재현 가능한 YAML 파이프라인.
  • 멀티모달 지원: Embodied AI, 비디오 이해 및 시맨틱 LLM 추출을 위한 전문 연산자 포함.
  • 프로덕션 준비 완료: Alibaba Cloud PAI와 통합되어 있으며 Ray를 통한 분산 실행을 지원함.