vortex-data/vortex
An extensible, state-of-the-art framework for columnar compression, and the fastest FOSS columnar file format. Formerly at @spiraldb, now an Incubation Stage project at LFAI&Data, part of the Linux Foundation.
何を解決するか
Vortex は、オブジェクトストレージをバックエンドに持つデータシステムのための、高性能な列指向ファイル形式とツールキットです。Apache Parquet などの既存形式のパフォーマンスのボトルネックを克服し、同程度の圧縮比を維持しながら、ランダムアクセスの読み取り、スキャン、書き込みがはるかに高速になります。
仕組み
Vortex は論理スキーマ(データ型)と物理レイアウト(データの保存方法)を分離しています。エンコーディング、圧縮、レイアウト戦略のプラグインアーキテクチャを採用しており、拡張性が非常に高いです。Apache Arrow とのゼロコピー互換性を設計しており、Vortex と Arrow の間でデータを転送する際に、高コストなコピーやメタデータの解析が不要です。
対象ユーザー
データシステム、分析エンジン、高性能コンピューティングアプリケーションを開発する開発者向けです。効率的なストレージとストレージベースのデータ処理を必要とする用途に最適です。
主な特徴
- 極めて高いパフォーマンス: 現代の Apache Parquet と比較して、ランダムアクセスの読み取りが最大100倍高速、スキャンが10〜20倍高速。
- 拡張性の高いアーキテクチャ: エンコーディング、データ型、圧縮のプラグインシステム。
- Arrow との統合: Apache Arrow 配列とのゼロコピー互換性。
- 広範な統合: DataFusion、DuckDB、Spark、Pandas、Polars との統合をサポート。
- 中立的なガバナンス: Linux Foundation (LF AI & Data) プロジェクトとして管理され、Apache-2.0 ライセンスで提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト