bacalhau-project/bacalhau
Community-driven, simple, yet powerful framework for fast, cost-effective distributed Compute over Data.
何を解決するか
Bacalhauは、大規模なデータセットをネットワーク全体に移動して処理する非効率性と高コストを解決します。中央のコンピューティングクラスタにデータを転送するのではなく、「データ上での計算」(CoD)アプローチを採用し、データが存在する場所でジョブを実行することで、遅延を低減し、エグレスコストを排除し、データ主権を維持します。
動作方法
Bacalhauは、クライアント、オーケストレーター、またはコンピューティングノードとして機能できる単一のバイナリからなる分散オーケストレーションフレームワークを使用します。オーケストレーターはジョブのスケジューリングを調整し、コンピューティングノードはDockerやWebAssemblyなどのエンジンを使ってタスクを実行します。S3、IPFS、HTTP/HTTPS、ローカルストレージなど、さまざまなストレージプロバイダーと統合され、データをその場で検索・処理できるため、YAMLによる宣言的またはCLIによる命令的に入力が可能です。
対象ユーザー
大規模なデータ(ペタバイト単位)を分散環境で管理する組織や開発者向けに設計されています。特に、分散機械学習、ログ処理、エッジコンピューティング、または保護されたデータセットを跨いで計算を行う場合に適しています。
特徴
- データ上での計算: データが作成された場所でジョブを処理し、移動を最小限に抑えます。
- 単一バイナリ: クライアント、オーケストレーター、ノードの役割を統合し、セットアップとスケーリングを簡素化します。
- 柔軟な実行: DockerやWebAssemblyなど、複数のエンジンをサポートします。
- 広範なストレージ対応: S3、IPFS、ローカルストレージと統合可能です。
- データ主権: データの生の形を露出せずに、セキュリティ境界内での処理を可能にします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト