vortex-data/vortex

An extensible, state-of-the-art framework for columnar compression, and the fastest FOSS columnar file format. Formerly at @spiraldb, now an Incubation Stage project at LFAI&Data, part of the Linux Foundation.

何を解決するか

Vortex は、オブジェクトストレージをバックエンドに持つデータシステムのための、高性能な列指向ファイル形式とツールキットです。Apache Parquet などの既存形式のパフォーマンスのボトルネックを克服し、同程度の圧縮比を維持しながら、ランダムアクセスの読み取り、スキャン、書き込みがはるかに高速になります。

仕組み

Vortex は論理スキーマ(データ型)と物理レイアウト(データの保存方法)を分離しています。エンコーディング、圧縮、レイアウト戦略のプラグインアーキテクチャを採用しており、拡張性が非常に高いです。Apache Arrow とのゼロコピー互換性を設計しており、Vortex と Arrow の間でデータを転送する際に、高コストなコピーやメタデータの解析が不要です。

対象ユーザー

データシステム、分析エンジン、高性能コンピューティングアプリケーションを開発する開発者向けです。効率的なストレージとストレージベースのデータ処理を必要とする用途に最適です。

主な特徴

  • 極めて高いパフォーマンス: 現代の Apache Parquet と比較して、ランダムアクセスの読み取りが最大100倍高速、スキャンが10〜20倍高速。
  • 拡張性の高いアーキテクチャ: エンコーディング、データ型、圧縮のプラグインシステム。
  • Arrow との統合: Apache Arrow 配列とのゼロコピー互換性。
  • 広範な統合: DataFusion、DuckDB、Spark、Pandas、Polars との統合をサポート。
  • 中立的なガバナンス: Linux Foundation (LF AI & Data) プロジェクトとして管理され、Apache-2.0 ライセンスで提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト