bacalhau-project/bacalhau

Community-driven, simple, yet powerful framework for fast, cost-effective distributed Compute over Data.

何を解決するか

Bacalhauは、大規模なデータセットをネットワーク全体に移動して処理する非効率性と高コストを解決します。中央のコンピューティングクラスタにデータを転送するのではなく、「データ上での計算」(CoD)アプローチを採用し、データが存在する場所でジョブを実行することで、遅延を低減し、エグレスコストを排除し、データ主権を維持します。

動作方法

Bacalhauは、クライアント、オーケストレーター、またはコンピューティングノードとして機能できる単一のバイナリからなる分散オーケストレーションフレームワークを使用します。オーケストレーターはジョブのスケジューリングを調整し、コンピューティングノードはDockerやWebAssemblyなどのエンジンを使ってタスクを実行します。S3、IPFS、HTTP/HTTPS、ローカルストレージなど、さまざまなストレージプロバイダーと統合され、データをその場で検索・処理できるため、YAMLによる宣言的またはCLIによる命令的に入力が可能です。

対象ユーザー

大規模なデータ(ペタバイト単位)を分散環境で管理する組織や開発者向けに設計されています。特に、分散機械学習、ログ処理、エッジコンピューティング、または保護されたデータセットを跨いで計算を行う場合に適しています。

特徴

  • データ上での計算: データが作成された場所でジョブを処理し、移動を最小限に抑えます。
  • 単一バイナリ: クライアント、オーケストレーター、ノードの役割を統合し、セットアップとスケーリングを簡素化します。
  • 柔軟な実行: DockerやWebAssemblyなど、複数のエンジンをサポートします。
  • 広範なストレージ対応: S3、IPFS、ローカルストレージと統合可能です。
  • データ主権: データの生の形を露出せずに、セキュリティ境界内での処理を可能にします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト