datahub-project/datahub

The Context Platform for your Data and AI Stack

DataHub – 오픈소스 AI 대응 메타데이터 카탈로그

무엇인가요 – DataHub는 조직 내 모든 데이터 자산(테이블, 대시보드, ML 모델, 파이프라인 등)의 통합 그래프를 구축하는 오픈소스 '메타데이터 플랫폼'입니다. LinkedIn에서 개발되었으며 2020년 오픈소스화되었으며, 현재는 DataHub 프로젝트와 기여자 커뮤니티가 유지 관리하고 있습니다.

왜 중요한가요 – 현대의 데이터 스택은 여러 도구에 분산되어 있습니다. 적절한 데이터셋을 찾고, 그 출처를 이해하며, 가버넌스를 시행하는 것은 어렵습니다. DataHub는 수십 개의 소스에서 메타데이터를 지속적으로 인게스트하고, 실시간 그래프에 저장하며, 인간과 AI 에이전트 모두가 쿼리할 수 있는 풍부한 API를 제공함으로써 이 문제를 해결합니다.


핵심 기능 (README에 기술됨)

  • 실시간 스트리밍 인게스트 – 메타데이터 업데이트는 몇 초 안에 Kafka를 통해 흐르며 카탈로그를 최신 상태로 유지합니다.
  • 80개 이상의 커넥터 – 웨어하우스(Snowflake, BigQuery, Redshift), 레이크, BI 도구, dbt, Airflow, ML 플랫폼 등에서 메타데이터를 추출하거나 전송하여 스키마, 라인리지, 사용 통계, 프로파일링, 품질 메트릭을 캡처합니다.
  • AI 대응Model Context Protocol (MCP) 및 새로운 오픈소스 Analytics Agent를 통해 LLM 기반 에이전트에 네이티브 지원. 자연어로 데이터 질문에 SQL, 결과, 차트를 반환할 수 있습니다.
  • 풍부한 UI – 검색, 컬럼 레벨 라인리지, 데이터셋 프로파일, 가버넌스 대시보드, 태그/용어/도메인, 전체 스택에 걸친 '유니버설 검색' 기능 제공.
  • 개발자 중심 API – GraphQL, OpenAPI, Python 및 Java SDK, 자동화를 위한 CLI (datahub).
  • 배포 유연성 – SaaS(DataHub Cloud), Docker-compose 빠른 시작, 또는 Kubernetes용 프로덕션 수준 Helm 차트. 플랫폼에는 GMS 백엔드, Elasticsearch, MySQL, Kafka 포함.
  • 엔터프라이즈 수준 보안 – 인증, 권한 부여, 감사 트레일, 세밀한 정책 지원.

일반적인 사용 사례

사용 사례 DataHub의 도움
데이터 탐색 유니버설 검색을 통해 분석가가 어떤 자산도 즉시 찾을 수 있음. UI는 스키마, 소유자, 문서를 표시합니다.
데이터 라인리지 및 영향 분석 컬럼 레벨 라인리지 그래프는 상류 소스와 하류 소비자를 보여주며, 변경 영향 평가에 유용합니다.
가버넌스 및 준수 태그 지정, 도메인 분류, 정책 대시보드를 통해 팀은 데이터 프라이버시 규칙(예: PII 처리)을 강제할 수 있습니다.
AI 에이전트 컨텍스트 카탈로그는 MCP를 통해 LLM 에이전트에 최신 메타데이터를 제공하여 신뢰할 수 있는 자연어 쿼리를 가능하게 합니다(오픈소스 Analytics Agent).
자동화 및 CI/CD 인게스트 레시피(YAML)를 CI 파이프라인에서 실행할 수 있으며, Python SDK를 통해 프로그램이 문서나 사용자 정의 속성을 프로그래밍 방식으로 추가할 수 있습니다.
셀프 서비스 분석 사용자는 평범한 영어로 질문할 수 있으며, Analytics Agent는 SQL을 생성하고 실행한 후 결과/차트를 반환합니다.

시작하기 (가장 빠른 경로)

  1. CLI 설치brew install datahub-project/tap/datahub (macOS/Linux) 또는 pip install acryl-datahub.
  2. Docker 빠른 시작 실행datahub docker quickstart. 이 명령어는 전체 스택(GMS, UI, Elasticsearch, MySQL, Kafka)을 시작하고 샘플 데이터를 로드합니다.
  3. 브라우저에서 http://localhost:9002 열기 (기본 인증 정보: datahub / datahub).
  4. 인게스트 가이드(예: README에 표시된 Snowflake 레시피) 또는 Python SDK를 사용하여 자신의 소스에 연결합니다.

프로덕션 환경에서는 docs/deploy/kubernetes.md의 Helm 차트 또는 관리형 SaaS(데이터허브 클라우드)를 사용하세요.


커뮤니티 및 리소스

  • Slackhttps://datahub.com/slack
  • YouTube – 튜토리얼 및 제품 데모 (https://www.youtube.com/@DataHubCloud)
  • 블로그 – 컨텍스트 관리, 라인리지, 메타데이터에 대한 심층 분석 (https://datahub.com/blog)
  • GitHub – 소스 코드, 이슈 트래커, 기여 가이드 (현재 읽고 있는 리포지토리)
  • Analytics Agent – LLM 통합을 보여주는 보조 리포지토리 (datahub-project/analytics-agent)

TL;DR

DataHub는 프로덕션 수준의 오픈소스 메타데이터 카탈로그로, 모든 데이터 자산에 대한 정보를 중앙 집중화하고, 스트리밍 인게스트를 통해 최신 상태를 유지하며, 인간과 AI 에이전트 모두를 위한 강력한 API를 제공합니다. Docker로 수분 내로 로컬에서 실행 가능하고, pip/Homebrew로 설치하거나 Helm으로 대규모 배포가 가능하여, 데이터 탐색, 가버넌스, LLM 기반 분석의 실용적인 기반을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트