apache/gravitino

World's most powerful open data catalog for building a high-performance, geo-distributed and federated metadata lake.

解決する課題

Apache Gravitinoは、異なるソース、タイプ、地理的地域にわたるデータおよびAI資産のメタデータを管理するための統一された方法を提供します。これにより、複数のバラバラなメタデータカタログを個別に管理する必要がなくなり、ユーザーはフェデレーション方式でデータとAI資産にアクセスし、ガバナンスを適用できるようになります。

仕組み

Gravitinoは、フェデレーション・メタデータ・レイクとして機能します。コネクタを使用して基盤となるシステム(Hive、MySQL、MariaDB、HDFS、S3など)と直接統合するため、ソースシステムでの変更が即座に反映されます。また、これらの多様なソースを管理するための単一のAPIとモデルを提供し、SQL方言の変更を必要とせずにTrinoやSparkなどのクエリエンジンと統合します。

対象ユーザー

マルチクラウドまたはハイブリッド環境全体でメタデータを管理し、地域間でメタデータを同期し、データとAI資産に対して統一されたガバナンス(アクセス制御と監査)を実装する必要があるデータエンジニア、AI実務家、およびアーキテクト。

ハイライト

  • 統合されたメタデータ管理: Hive、MySQL、MariaDB、HDFS、S3を含む多様なソースに対する単一のAPI。
  • エンドツーエンドのガバナンス: すべての資産にわたる統合されたアクセス制御、監査、およびディスカバリ。
  • 地理分散: 異なる地域やクラウド間でのメタデータ共有をサポート。
  • AI資産管理: AIモデルと特徴量のトラッキングをサポート(現在開発中)。
  • ネイティブRESTカタログ: ネイティブなIcebergおよびLance RESTカタログサービスを提供。
  • マルチエンジン互換性: TrinoやSparkなどのエンジンとのシームレスな統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト