bacalhau-project/bacalhau

Community-driven, simple, yet powerful framework for fast, cost-effective distributed Compute over Data.

解决的问题

Bacalhau 解决了将大规模数据集跨网络传输以进行处理所带来的低效和高成本问题。与其将数据传输到中心化计算集群,Bacalhau 采用「数据上计算」(CoD)方法,在数据所在位置直接执行任务,从而降低延迟、消除出站成本,并保障数据主权。

工作原理

Bacalhau 使用一个单一二进制文件构成的分布式编排框架,该二进制文件可充当客户端、编排器或计算节点。编排器负责任务调度,计算节点则使用 Docker 或 WebAssembly 等引擎执行任务。它与多种存储提供商(S3、IPFS、HTTP/HTTPS、本地)集成,能够在数据所在地直接查找并处理数据,用户可通过 YAML 声明式或 CLI 命令式提交任务。

适用对象

专为在分布式环境中管理大规模数据(PB 级)的组织和开发者设计,适用于分布式机器学习、日志处理、边缘计算,或在受保护数据集上进行跨组织计算的场景。

核心亮点

  • 数据上计算:在数据生成位置处理任务,最大限度减少数据移动。
  • 单个二进制文件:将客户端、编排器和节点角色整合于一体,简化部署与扩展。
  • 灵活执行:支持 Docker、WebAssembly 等多种执行引擎。
  • 广泛存储支持:与 S3、IPFS 和本地存储无缝集成。
  • 数据主权:在安全边界内处理敏感数据,无需暴露原始数据。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目