apache/gravitino
World's most powerful open data catalog for building a high-performance, geo-distributed and federated metadata lake.
해결하는 문제
Apache Gravitino는 다양한 소스, 유형 및 지리적 지역에 걸친 데이터 및 AI 자산의 메타데이터를 관리하는 통합된 방법을 제공합니다. 이를 통해 여러 분산된 메타데이터 카탈로그를 개별적으로 관리할 필요가 없으며, 사용자는 연합 방식으로 데이터 및 AI 자산에 액세스하고 거버넌스를 적용할 수 있습니다.
작동 원리
Gravitino는 연합 메타데이터 레이크 역할을 합니다. 커넥터를 사용하여 기본 시스템(Hive, MySQL, MariaDB, HDFS, S3 등)과 직접 통합되므로 소스 시스템의 변경 사항이 즉시 반영됩니다. 또한 이러한 다양한 소스를 관리하기 위한 단일 API 및 모델을 제공하며, SQL 방언을 변경할 필요 없이 Trino 및 Spark와 같은 쿼리 엔진과 통합됩니다.
대상 사용자
멀티 클라우드 또는 하이브리드 설정에서 메타데이터를 관리하고, 지역 간에 메타데이터를 동기화하며, 데이터 및 AI 자산에 대해 통합된 거버넌스(액세스 제어 및 감사)를 구현해야 하는 데이터 엔지니어, AI 전문가 및 아키텍트.
주요 특징
- 통합 메타데이터 관리: Hive, MySQL, MariaDB, HDFS, S3를 포함한 다양한 소스에 대한 단일 API.
- 엔드 투 엔드 거버넌스: 모든 자산에 걸친 통합된 액세스 제어, 감사 및 디스커버리.
- 지리적 분산: 다양한 지역 및 클라우드 간의 메타데이터 공유 지원.
- AI 자산 관리: AI 모델 및 피처 추적 지원(현재 개발 중).
- 네이티브 REST 카탈로그: 네이티브 Iceberg 및 Lance REST 카탈로그 서비스 제공.
- 멀티 엔진 호환성: Trino 및 Spark와 같은 엔진과 원활한 통합.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트