vortex-data/vortex
An extensible, state-of-the-art framework for columnar compression, and the fastest FOSS columnar file format. Formerly at @spiraldb, now an Incubation Stage project at LFAI&Data, part of the Linux Foundation.
解决的问题
Vortex 是一种高性能列式文件格式和工具包,专为优化数据处理而设计,尤其适用于基于对象存储的系统。它解决了 Apache Parquet 等现有格式的性能瓶颈,提供显著更快的随机读取、扫描和写入速度,同时保持相近的压缩比。
工作原理
Vortex 将逻辑模式(数据类型)与物理布局(数据存储方式)分离。它采用可插拔的编码、压缩和布局策略架构,具有高度可扩展性。其设计支持与 Apache Arrow 的零拷贝兼容,意味着数据在 Vortex 与 Arrow 之间传输时无需昂贵的复制或元数据解析。
适用人群
本项目适用于开发数据系统、分析引擎和高性能计算应用的开发者,这些应用需要高效的存储和基于存储的数据处理能力。
主要亮点
- 极致性能:相比现代 Apache Parquet,随机读取速度最高快 100 倍,扫描速度快 10-20 倍。
- 可扩展架构:支持编码、类型和压缩的可插拔系统。
- Arrow 集成:与 Apache Arrow 数组实现零拷贝兼容。
- 广泛集成:支持与 DataFusion、DuckDB、Spark、Pandas 和 Polars 的集成。
- 中立治理:作为 Linux Foundation (LF AI & Data) 项目管理,采用 Apache-2.0 许可证。
相关
- 项目
- 项目
- 项目
- 项目
- 项目