bodo-ai/Bodo

High Performance Scalable Data Processing in Python and SQL

解决的问题

Bodo DataFrames 解决了 Python 数据处理在大规模 AI/ML 工作负载中的性能和可扩展性瓶颈。它消除了传统分布式框架(如 Spark 或 Dask)中的运行时开销,并允许 Pandas 代码在不完全重写代码库的情况下扩展到超出内存的数据集。

工作原理

它作为 Pandas 的即插即用替代品,通过替换导入语句实现。其底层使用 C++ 运行时和消息传递接口(MPI)技术实现真正的并行执行。同时采用即时(JIT)编译器加速自定义转换,并原生支持 NumPy 和 Scikit-learn,还集成了 SQL 引擎和流式执行能力,以处理海量数据集。

适用人群

使用 Pandas 进行数据准备和特征工程,但需要 HPC 级性能,并能够在大型云集群或高核心数笔记本电脑上扩展工作负载的数据科学家和 AI 工程师。

主要亮点

  • 即插即用兼容性:只需将 import pandas as pd 改为 import bodo.pandas as pd,即可加速工作负载。
  • HPC 性能:利用 MPI 实现显著快于 Spark 或 Dask 的性能。
  • JIT 编译:通过原生支持 Pandas、NumPy 和 Scikit-learn,加速自定义函数和转换。
  • 企业级数据集成:内置对 Apache Iceberg、Snowflake、Parquet、CSV 和 JSON 的可扩展 I/O 支持。
  • 内存效率:支持流式执行,可处理超出可用 RAM 的数据集。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch