apache/gravitino

World's most powerful open data catalog for building a high-performance, geo-distributed and federated metadata lake.

解決的問題

Apache Gravitino 提供了一種統一的方式來管理來自不同來源、類型和地理區域的數據及 AI 資產的元數據。它消除了需要近距離管理多個分散元數據目錄的需求,允許用戶以聯邦方式存取並治理數據及 AI 資產。

工作原理

Gravitino 作為一個聯邦元數據湖發揮作用。它使用連接器直接與底層系統(如 Hive、MySQL、MariaDB、HDFS 和 S3)集成,因此來源系統中的變更會立即反映出來。它提供單一的 API 和模型來管理這些多樣化的數據源,並可以在無需更改 SQL 方言的情況下與 Trino 和 Spark 等查詢引擎集成。

適用對象

需要在多雲或混合設置中管理元數據、跨區域同步元數據,並為數據及 AI 資產實施統一治理(存取控制與審計)的數據工程師、AI 從業者和架構師。

亮點

  • 統一的元數據管理:針對包括 Hive、MySQL、MariaDB、HDFS 和 S3 在內的多種數據源的單一 API。
  • 端到端治理:跨所有資產的集成存取控制、審計與發現。
  • 地理分散:支持跨不同區域與雲的元數據共享。
  • AI 資產管理:支持追蹤 AI 模型與特徵(目前正在開發中)。
  • 原生 REST 目錄:提供原生的 Iceberg 與 Lance REST 目錄服務。
  • 多引擎相容性:與 Trino 和 Spark 等引擎無縫集成。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案