datahub-project/datahub

The Context Platform for your Data and AI Stack

DataHub – 開源 AI 就緒的元資料目錄

是什麼 – DataHub 是一個開源的「元資料平台」,可建構組織內所有資料資產(資料表、儀表板、機器學習模型、資料流程等)的統一圖譜。它源自 LinkedIn,於 2020 年開源,現由 DataHub 項目與貢獻者社群維護。

為何重要 – 現代資料堆疊分散於多個工具中。找到正確的資料集、理解其來源、執行治理非常困難。DataHub 透過從數十個來源持續攝取元資料,儲存於即時圖譜中,並提供豐富 API,供人類與 AI 代理查詢,從而解決此問題。


核心功能(如 README 所述)

  • 即時串流攝取 – 元資料更新透過 Kafka 在數秒內流動,保持目錄即時更新。
  • 80+ 連接器 – 從資料倉儲(Snowflake、BigQuery、Redshift)、資料湖、BI 工具、dbt、Airflow、機器學習平台等拉取或推送元資料,捕捉模式、血緣、使用統計、分析、品質指標等。
  • AI 就緒 – 透過 Model Context Protocol(MCP)與新開源的 Analytics Agent,原生支援 LLM 驅動的代理,可回答自然語言資料問題,回傳 SQL、結果與圖表。
  • 豐富的 UI – 搜尋、欄位級血緣、資料集概覽、治理儀表板、標籤/術語/領域,以及跨整個堆疊的「通用搜尋」。
  • 開發者導向 API – GraphQL、OpenAPI、Python 與 Java SDK,以及用於自動化的 CLI(datahub)。
  • 部署彈性 – SaaS(DataHub Cloud)、Docker-compose 快速啟動,或用於 Kubernetes 的生產級 Helm 圖表。平台包含 GMS 後端、Elasticsearch、MySQL 與 Kafka。
  • 企業級安全 – 認證、授權、稽核日誌與細粒度策略。

典型用例

用例 DataHub 如何協助
資料發現 通用搜尋可讓分析師即時定位任意資產;UI 顯示模式、所有者與文件。
資料血緣與影響分析 欄位級血緣圖揭示上游來源與下游消費者,有助於變更影響評估。
治理與合規 標籤、領域分類與策略儀表板使團隊能強制執行資料隱私規則(如 PII 處理)。
AI 代理上下文 透過 MCP,目錄向 LLM 代理提供最新元資料,支援可靠的自然語言查詢(開源 Analytics Agent)。
自動化與 CI/CD 可從 CI 管道執行攝取配方(YAML);Python SDK 允許程式化新增文件或自訂屬性。
自助式分析 使用者可提出自然語言問題;Analytics Agent 生成 SQL、執行並回傳結果/圖表。

快速入門(最短路徑)

  1. 安裝 CLIbrew install datahub-project/tap/datahub(macOS/Linux) pip install acryl-datahub
  2. 執行 Docker 快速啟動datahub docker quickstart。此指令將啟動完整堆疊(GMS、UI、Elasticsearch、MySQL、Kafka)並載入範例資料。
  3. 在瀏覽器中開啟 http://localhost:9002(預設憑證:datahub / datahub)。
  4. 使用攝取指南(例如 README 中顯示的 Snowflake 配方)或 Python SDK 連接自己的資料來源。

生產環境可使用 docs/deploy/kubernetes.md 中的 Helm 圖表或託管 SaaS 服務(DataHub Cloud)。


社群與資源


TL;DR

DataHub 是一個生產級開源元資料目錄,集中管理所有資料資產資訊,透過串流攝取保持最新,並為人類與 AI 代理提供強大 API。它可透過 Docker 在數分鐘內本地執行,也可透過 pip/Homebrew 安裝,或使用 Helm 擴展部署,是資料發現、治理與 LLM 驅動分析的實用基礎。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案