datachain-ai/datachain

The Context Layer for unstructured data: typed, versioned datasets over S3, GCS, Azure

What it solves

DataChain 은 클라우드 버킷(S3, GCS, Azure)에 저장된 이미지, 비디오, 문서와 같은 방대한 비구조화 데이터의 관리·쿼리·처리 어려움을 해결합니다. 데이터를 데이터베이스로 복사할 필요를 없애고, 데이터셋 버전 관리를 제공하며, 전체 데이터셋을 메모리로 로드하지 않고도 고속 메타데이터 쿼리와 유사도 검색을 가능하게 합니다.

How it works

DataChain 은 "컨텍스트 레이어" 역할을 하여 Pydantic 스키마를 사용해 클라우드 스토리지를 타입이 지정된 데이터셋으로 인덱싱합니다. 주요 구성 요소는 다음 세 가지입니다.

  1. Compute Engine: 파일에 대해 사용자 정의 함수(UDF)를 실행하는 병렬·분산 Python 엔진으로, async I/O, 실패 시 체크포인트 복구, 새로운 파일만 처리하는 증분 업데이트 기능을 제공합니다.
  2. Dataset DB: 영구 저장소(로컬 SQLite)로 스키마, 버전, 파일 포인터, 메타데이터를 추적합니다. 이를 통해 수백만 레코드에 대해 서브초 수준의 필터링, 조인, 벡터 유사도 검색이 가능합니다.
  3. Knowledge Base: 데이터셋 구조와 라인지를 인간과 AI 에이전트 모두가 읽을 수 있도록 하는 markdown 요약 레이어입니다.

Who it’s for

데이터 엔지니어와 AI 실무자를 위해 설계되었으며, 비구조화 데이터에 대한 탄력적인 파이프라인을 구축하고 데이터 컨텍스트를 AI 에이전트 워크플로우(예: Claude Code, Cursor, GitHub Copilot)와 직접 통합하려는 경우에 적합합니다.

Highlights

  • Zero-copy indexing: 데이터는 클라우드 스토리지에 그대로 남아 있으며, 관리되는 것은 메타데이터와 포인터뿐입니다.
  • Resilient pipelines: 자동 체크포인트 덕분에 파이프라인이 충돌 후 마지막 성공 배치부터 재개될 수 있습니다.
  • Warehouse-speed queries: 벡터와 메타데이터 필터가 Dataset DB에 대한 벡터화 연산으로 실행됩니다.
  • Agent Integration: AI 에이전트가 데이터 스키마를 이해하고 파이프라인을 자동으로 생성할 수 있는 "스킬"을 포함합니다.
  • Incremental Processing: delta=True 설정을 사용해 새 파일이나 변경된 파일만 처리합니다.