apache/gravitino
World's most powerful open data catalog for building a high-performance, geo-distributed and federated metadata lake.
解決的問題
Apache Gravitino 提供了一種統一的方式來管理來自不同來源、類型和地理區域的數據及 AI 資產的元數據。它消除了需要近距離管理多個分散元數據目錄的需求,允許用戶以聯邦方式存取並治理數據及 AI 資產。
工作原理
Gravitino 作為一個聯邦元數據湖發揮作用。它使用連接器直接與底層系統(如 Hive、MySQL、MariaDB、HDFS 和 S3)集成,因此來源系統中的變更會立即反映出來。它提供單一的 API 和模型來管理這些多樣化的數據源,並可以在無需更改 SQL 方言的情況下與 Trino 和 Spark 等查詢引擎集成。
適用對象
需要在多雲或混合設置中管理元數據、跨區域同步元數據,並為數據及 AI 資產實施統一治理(存取控制與審計)的數據工程師、AI 從業者和架構師。
亮點
- 統一的元數據管理:針對包括 Hive、MySQL、MariaDB、HDFS 和 S3 在內的多種數據源的單一 API。
- 端到端治理:跨所有資產的集成存取控制、審計與發現。
- 地理分散:支持跨不同區域與雲的元數據共享。
- AI 資產管理:支持追蹤 AI 模型與特徵(目前正在開發中)。
- 原生 REST 目錄:提供原生的 Iceberg 與 Lance REST 目錄服務。
- 多引擎相容性:與 Trino 和 Spark 等引擎無縫集成。
相關
- 專案
- 專案
- 專案
- 專案
- 專案