vortex-data/vortex
An extensible, state-of-the-art framework for columnar compression, and the fastest FOSS columnar file format. Formerly at @spiraldb, now an Incubation Stage project at LFAI&Data, part of the Linux Foundation.
해결하는 문제
Vortex는 객체 스토리지 기반 데이터 시스템을 위한 고성능 열 지향 파일 형식 및 툴킷으로, 데이터 처리 최적화를 목표로 합니다. Apache Parquet와 같은 기존 형식의 성능 한계를 극복하여, 유사한 압축 비율을 유지하면서도 랜덤 액세스 읽기, 스캔, 쓰기 속도를 크게 향상시킵니다.
작동 방식
Vortex는 논리적 스키마(데이터 유형)와 물리적 레이아웃(데이터 저장 방식)을 분리합니다. 인코딩, 압축, 레이아웃 전략에 대해 플러그인 아키텍처를 사용하여 매우 확장 가능하도록 설계되었습니다. Apache Arrow와의 제로 코피 호환성을 설계하여, Vortex와 Arrow 간의 데이터 전송 시 비용이 큰 복사 또는 메타데이터 파싱이 필요하지 않습니다.
대상 사용자
효율적인 스토리지와 스토리지 기반 데이터 처리가 필요한 데이터 시스템, 분석 엔진, 고성능 컴퓨팅 애플리케이션을 개발하는 개발자에게 적합합니다.
주요 특징
- 극도의 성능: 최대 100배 빠른 랜덤 액세스 읽기, 현대적인 Apache Parquet 대비 10~20배 빠른 스캔.
- 확장 가능한 아키텍처: 인코딩, 타입, 압축에 대한 플러그인 시스템.
- Arrow 통합: Apache Arrow 배열과의 제로 코피 호환성.
- 광범위한 통합: DataFusion, DuckDB, Spark, Pandas, Polars와의 통합 지원.
- 중립적 거버넌스: Linux Foundation (LF AI & Data) 프로젝트로 관리되며 Apache-2.0 라이선스 하에 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트