vortex-data/vortex
An extensible, state-of-the-art framework for columnar compression, and the fastest FOSS columnar file format. Formerly at @spiraldb, now an Incubation Stage project at LFAI&Data, part of the Linux Foundation.
解決的問題
Vortex 是一種高效率的欄式檔案格式與工具包,專為優化資料處理而設計,特別適用於基於物件儲存的系統。它克服了 Apache Parquet 等現有格式的效能瓶頸,提供顯著更快的隨機存取讀取、掃描與寫入速度,同時維持相近的壓縮比。
工作原理
Vortex 將邏輯結構(資料類型)與物理佈局(資料儲存方式)分離。採用可插入的編碼、壓縮與佈局策略架構,具有高度可擴充性。其設計支援與 Apache Arrow 的零複製相容,表示資料在 Vortex 與 Arrow 之間傳輸時,無需耗時的複製或元資料解析。
適用對象
本專案適用於開發資料系統、分析引擎與高效率運算應用的開發者,這些應用需要高效儲存與基於儲存的資料處理能力。
主要亮點
- 極致效能:相比現代 Apache Parquet,隨機讀取速度最快快 100 倍,掃描速度快 10–20 倍。
- 可擴充架構:支援編碼、類型與壓縮的可插入系統。
- Arrow 集成:與 Apache Arrow 陣列實現零複製相容。
- 廣泛整合:支援與 DataFusion、DuckDB、Spark、Pandas 及 Polars 的整合。
- 中立治理:由 Linux Foundation (LF AI & Data) 項目管理,採用 Apache-2.0 許可證。
相關
- 專案
- 專案
- 專案
- 專案
- 專案