bodo-ai/Bodo

High Performance Scalable Data Processing in Python and SQL

解決する課題

Bodo DataFrames は、大規模な AI/ML ワークロード向けに Python データ処理のパフォーマンスとスケーラビリティのボトルネックを解決します。従来の分散フレームワーク(Spark や Dask など)に見られるランタイムオーバーヘッドを排除し、コードベースの完全な再実装なしに、メモリを超えるデータセットに Pandas コードをスケーラブルに拡張可能にします。

動作方法

Pandas のインポート文を置き換えることで、Pandas のドロップイン代替として機能します。内部的には C++ ランタイムと Message Passing Interface (MPI) 技術を使用して真の並列実行を実現します。また、Just-in-Time (JIT) コンパイラを採用し、カスタム変換を高速化。NumPy や Scikit-learn へのネイティブサポートに加え、統合 SQL エンジンとストリーミング実行により、大規模データセットの処理を可能にします。

対象ユーザー

データ準備や特徴工学に Pandas を使用しているデータサイエンティストや AI エンジニアで、HPC 水準のパフォーマンスと、大規模クラウドクラスターや高コア数のラップトップ上でワークロードをスケーラブルに実行したい方。

主な特徴

  • ドロップイン互換性: import pandas as pdimport bodo.pandas as pd に変更するだけでワークロードを加速。
  • HPC パフォーマンス: MPI を活用し、Spark や Dask よりも大幅に高速。
  • JIT コンパイル: Pandas、NumPy、Scikit-learn へのネイティブサポートにより、カスタム関数や変換を高速化。
  • エンタープライズデータ統合: Apache Iceberg、Snowflake、Parquet、CSV、JSON に対応するスケーラブルな I/O を内蔵。
  • メモリ効率: ストリーミング実行をサポートし、利用可能な RAM を超えるデータセットを処理可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch