datahub-project/datahub

The Context Platform for your Data and AI Stack

DataHub – 开源 AI 就绪元数据目录

是什么 – DataHub 是一个开源的「元数据平台」,可构建组织内所有数据资产(表、仪表板、机器学习模型、管道等)的统一图谱。它起源于 LinkedIn,2020 年开源,现由 DataHub 项目和贡献者社区维护。

为何重要 – 现代数据栈分散在多个工具中。找到正确的数据集、理解其来源、实施治理非常困难。DataHub 通过从数十个来源持续摄取元数据,将其存储在实时图谱中,并提供丰富 API,供人类和 AI 代理查询,从而解决这一问题。


核心功能(如 README 所述)

  • 实时流式摄取 – 元数据更新通过 Kafka 在数秒内流动,保持目录的实时性。
  • 80+ 连接器 – 从数据仓库(Snowflake、BigQuery、Redshift)、数据湖、BI 工具、dbt、Airflow、机器学习平台等拉取或推送元数据,捕获模式、血缘、使用统计、分析、质量指标等。
  • AI 就绪 – 通过 Model Context Protocol(MCP)和新开源的 Analytics Agent,原生支持 LLM 驱动的代理,可回答自然语言数据问题,返回 SQL、结果和图表。
  • 丰富的 UI – 搜索、列级血缘、数据集概览、治理仪表板、标签/术语/领域,以及跨整个栈的「通用搜索」。
  • 开发者优先 API – GraphQL、OpenAPI、Python 与 Java SDK,以及用于自动化的 CLI(datahub)。
  • 部署灵活性 – SaaS(DataHub Cloud)、Docker-compose 快速启动,或用于 Kubernetes 的生产级 Helm 图表。平台包含 GMS 后端、Elasticsearch、MySQL 和 Kafka。
  • 企业级安全 – 认证、授权、审计日志和细粒度策略。

典型用例

用例 DataHub 如何帮助
数据发现 通用搜索可让分析师即时定位任意资产;UI 显示模式、所有者和文档。
数据血缘与影响分析 列级血缘图揭示上游来源和下游消费者,有助于变更影响评估。
治理与合规 标签、领域分类和策略仪表板使团队能够强制执行数据隐私规则(如 PII 处理)。
AI 代理上下文 通过 MCP,目录向 LLM 代理提供最新元数据,支持可靠的自然语言查询(开源 Analytics Agent)。
自动化与 CI/CD 可从 CI 管道运行摄取配方(YAML);Python SDK 允许程序化添加文档或自定义属性。
自助式分析 用户可提出自然语言问题;Analytics Agent 生成 SQL、执行并返回结果/图表。

快速入门(最短路径)

  1. 安装 CLIbrew install datahub-project/tap/datahub(macOS/Linux) pip install acryl-datahub
  2. 运行 Docker 快速启动datahub docker quickstart。这将启动完整堆栈(GMS、UI、Elasticsearch、MySQL、Kafka)并加载示例数据。
  3. 在浏览器中打开 http://localhost:9002(默认凭证:datahub / datahub)。
  4. 使用摄取指南(例如 README 中显示的 Snowflake 配方)或 Python SDK 连接自己的数据源。

生产环境可使用 docs/deploy/kubernetes.md 中的 Helm 图表或托管 SaaS 服务(DataHub Cloud)。


社区与资源


TL;DR

DataHub 是一个生产级开源元数据目录,集中管理所有数据资产信息,通过流式摄取保持最新,并为人类和 AI 代理提供强大 API。它可通过 Docker 在几分钟内本地运行,也可通过 pip/Homebrew 安装,或使用 Helm 扩展部署,是数据发现、治理和 LLM 驱动分析的实用基础。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目