data-prep-kit/data-prep-kit
Open source project for data preparation for GenAI applications
해결하는 문제
Data-Prep-Kit는 대규모 언어 모델(LLM)을 위한 비구조화 데이터 준비 과정을 단순화합니다. 사전 훈련, 파인튜닝, 지시 훈련 또는 검색 증강 생성(RAG) 애플리케이션 구축에 사용되는 데이터를 청소, 변환, 풍부화하는 방식으로 확장 가능하게 제공합니다.
작동 방식
이 키트는 자연어, 코드, 이미지에 적용 가능한 모듈식 변환 도구의 확장 가능한 라이브러리로 구성되어 있습니다. Python과 Ray 기반으로 구축되어 있어 단일 랩톱에서부터 전체 데이터 센터까지 확장 가능합니다. Parquet, ZIP, NDJSON, JSONL 등의 다양한 파일 형식을 지원합니다. 복잡한 워크플로우의 경우, 변환을 Kubernetes 클러스터에서 작업으로 배포하거나 Tekton 파이프라인을 사용해 순차적으로 실행할 수 있습니다.
대상 사용자
모델 훈련 또는 RAG 파이프라인을 위해 대량의 비구조화 데이터를 처리해야 하는 LLM 애플리케이션 개발자.
주요 특징
- 다중 모달 지원: 자연어, 코드, 이미지 데이터를 처리 가능.
- 확장 가능한 아키텍처: Python과 Ray 런타임 모두 지원하여 대규모 확장 가능.
- 모듈식 변환 라이브러리: HTML → Parquet 인게스트, 정확 및 흐릿한 중복 제거, 품질 주석, PII 마스킹, 언어 식별 등 도구 포함.
- 엔터프라이즈 대응 배포: Kubernetes 및 Tekton 파이프라인과 호환되어 자동화 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트