bodo-ai/Bodo

High Performance Scalable Data Processing in Python and SQL

解決的問題

Bodo DataFrames 解決了 Python 數據處理在大規模 AI/ML 工作負載中的效能與可擴展性瓶頸。它消除了傳統分散式框架(如 Spark 或 Dask)中的執行時間開銷,並允許 Pandas 程式碼在不完全重寫程式碼庫的情況下,擴展至超出記憶體的資料集。

工作原理

它作為 Pandas 的即插即用替代品,透過取代 import 語句來實現。其底層使用 C++ 執行時與訊息傳遞介面(MPI)技術,實現真正的平行執行。同時採用即時(JIT)編譯器加速自訂轉換,並原生支援 NumPy 與 Scikit-learn,還整合了 SQL 引擎與串流執行功能,以處理龐大資料集。

適用對象

使用 Pandas 進行資料準備與特徵工程,但需要 HPC 級效能,並能在大型雲端叢集或高核心數筆電上擴展工作負載的資料科學家與 AI 工程師。

主要特色

  • 即插即用相容性:只需將 import pandas as pd 改為 import bodo.pandas as pd,即可加速工作負載。
  • HPC 性能:利用 MPI 實現顯著快於 Spark 或 Dask 的效能。
  • JIT 編譯:透過原生支援 Pandas、NumPy 與 Scikit-learn,加速自訂函數與轉換。
  • 企業級資料整合:內建支援 Apache Iceberg、Snowflake、Parquet、CSV 與 JSON 的可擴展 I/O。
  • 記憶體效率:支援串流執行,可處理超出可用 RAM 的資料集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch