OpenDCAI/DataFlow

Easy Data Preparation with latest LLMs-based Operators and Pipelines.

해결하는 문제

DataFlow는 노이즈가 있는 원시 데이터(PDF, plain-text, 저품질 QA 쌍 등)를 대규모 언어 모델(LLM)을 위한 고품질 학습 데이터셋으로 변환하도록 설계된 데이터 중심 AI 시스템입니다. 특히 의료, 금융, 법률 및 학술 연구와 같은 분야에서 수동 데이터 정제 및 합성에 소요되는 시간과 비용 문제를 해결합니다.

작동 방식

이 시스템은 개별 데이터 처리 작업(생성, 평가, 필터링 및 정제)이 연산자(operator)로 캡슐화된 "연산자 기반" 설계를 사용합니다. 이러한 연산자는 재현 가능하고 공유 가능한 파이프라인으로 오케스트레이션됩니다.

주요 구성 요소는 다음과 같습니다:

  • Operators: 구조화된 입력(JSON, JSONL, CSV)을 받아 처리된 출력을 생성하는 모듈형 단위.
  • Pipelines: 특정 데이터 워크플로우(예: Text, Reasoning, Text2SQL, Knowledge Base Cleaning)를 정의하는 연산자의 시퀀스.
  • DataFlow-WebUI: 드래그 앤 드롭 또는 자연어를 통해 이러한 파이프라인을 구축하고 실행할 수 있는 시각적 로우코드 작업 공간.
  • DataFlow-Agent: 데이터를 분석하고 사용자 정의 연산자를 작성하며 파이프라인을 자동으로 조립할 수 있는 지능형 어시스턴트.

대상 사용자

DataFlow는 사전 학습(Pre-training), 지도 미세 조정(SFT), RL 학습 또는 RAG 시스템을 위한 고품질 데이터 준비를 확장해야 하는 AI 연구자 및 기업을 위해 구축되었습니다.

주요 특징

  • 로우코드 오케스트레이션: 빠른 실험을 위한 WebUI 기반의 시각적 파이프라인 빌더.
  • 즉시 사용 가능한 파이프라인: 텍스트, 수학, 코드 및 PDF로부터의 구조화된 데이터 추출을 위한 사전 구축된 워크플로우.
  • PyTorch 스타일 구조: 명확한 워크플로우 제어를 위한 계층적 Pipeline $ ightarrow$ Operator $ ightarrow$ Prompt 구성.
  • 분산 확장성: 대규모 데이터 작업의 고성능 오케스트레이션을 위한 RayOrch와의 통합.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트