bacalhau-project/bacalhau

Community-driven, simple, yet powerful framework for fast, cost-effective distributed Compute over Data.

解決的問題

Bacalhau 解決了將大型資料集跨網路傳輸以進行處理所造成的低效率與高成本問題。不需將資料傳輸至中央計算叢集,Bacalhau 採用「資料上計算」(CoD)方法,在資料所在位置直接執行工作,從而降低延遲、消除出站成本,並維持資料主權。

工作原理

Bacalhau 使用由單一二進位檔組成的分散式編排框架,該二進位檔可作為客戶端、編排器或計算節點。編排器負責工作排程,計算節點則使用 Docker 或 WebAssembly 等引擎執行任務。它與多種儲存提供者(S3、IPFS、HTTP/HTTPS、本地)整合,可在資料所在地直接查找並處理資料,使用者可透過 YAML 以宣告式或 CLI 以指令式提交工作。

適用對象

專為在分散式環境中管理大型資料(PB 級)的組織與開發者設計,適用於分散式機器學習、日誌處理、邊緣運算,或在受保護資料集上進行跨組織運算的場景。

核心亮點

  • 資料上計算:在資料產生位置處理工作,最大限度減少資料移動。
  • 單一二進位檔:整合客戶端、編排器與節點角色,簡化部署與擴展。
  • 靈活執行:支援 Docker、WebAssembly 等多種執行引擎。
  • 廣泛儲存支援:與 S3、IPFS 和本地儲存無縫整合。
  • 資料主權:在安全邊界內處理敏感資料,無需暴露原始資料。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案