apache/gravitino
World's most powerful open data catalog for building a high-performance, geo-distributed and federated metadata lake.
解決する課題
Apache Gravitinoは、異なるソース、タイプ、地理的地域にわたるデータおよびAI資産のメタデータを管理するための統一された方法を提供します。これにより、複数のバラバラなメタデータカタログを個別に管理する必要がなくなり、ユーザーはフェデレーション方式でデータとAI資産にアクセスし、ガバナンスを適用できるようになります。
仕組み
Gravitinoは、フェデレーション・メタデータ・レイクとして機能します。コネクタを使用して基盤となるシステム(Hive、MySQL、MariaDB、HDFS、S3など)と直接統合するため、ソースシステムでの変更が即座に反映されます。また、これらの多様なソースを管理するための単一のAPIとモデルを提供し、SQL方言の変更を必要とせずにTrinoやSparkなどのクエリエンジンと統合します。
対象ユーザー
マルチクラウドまたはハイブリッド環境全体でメタデータを管理し、地域間でメタデータを同期し、データとAI資産に対して統一されたガバナンス(アクセス制御と監査)を実装する必要があるデータエンジニア、AI実務家、およびアーキテクト。
ハイライト
- 統合されたメタデータ管理: Hive、MySQL、MariaDB、HDFS、S3を含む多様なソースに対する単一のAPI。
- エンドツーエンドのガバナンス: すべての資産にわたる統合されたアクセス制御、監査、およびディスカバリ。
- 地理分散: 異なる地域やクラウド間でのメタデータ共有をサポート。
- AI資産管理: AIモデルと特徴量のトラッキングをサポート(現在開発中)。
- ネイティブRESTカタログ: ネイティブなIcebergおよびLance RESTカタログサービスを提供。
- マルチエンジン互換性: TrinoやSparkなどのエンジンとのシームレスな統合。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト