apache/gravitino

World's most powerful open data catalog for building a high-performance, geo-distributed and federated metadata lake.

解决的问题

Apache Gravitino 提供了一种统一的方式来管理来自不同数据源、类型和地理区域的数据及 AI 资产的元数据。它消除了需要近距离管理多个分散元数据目录的需求,允许用户以联邦方式访问和治理数据及 AI 资产。

工作原理

Gravitino 作为一个联邦元数据湖发挥作用。它使用连接器直接与底层系统(如 Hive、MySQL、MariaDB、HDFS 和 S3)集成,因此源系统中的更改会立即反映出来。它提供单一的 API 和模型来管理这些多样化的数据源,并可以在无需更改 SQL 方言的情况下与 Trino 和 Spark 等查询引擎集成。

适用对象

需要在多云或混合设置中管理元数据、跨区域同步元数据,并为数据及 AI 资产实施统一治理(访问控制和审计)的数据工程师、AI 从业者和架构师。

亮点

  • 统一的元数据管理:针对包括 Hive、MySQL、MariaDB、HDFS 和 S3 在内的多种数据源的单一 API。
  • 端到端治理:跨所有资产的集成访问控制、审计和发现。
  • 地理分布:支持跨不同区域和云的元数据共享。
  • AI 资产管理:支持跟踪 AI 模型和特征(目前正在开发中)。
  • 原生 REST 目录:提供原生的 Iceberg 和 Lance REST 目录服务。
  • 多引擎兼容性:与 Trino 和 Spark 等引擎无缝集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目