pathwaycom/pathway-benchmarks

Benchmarks for data processing systems: Pathway Live Data Framework, Spark, Flink, Kafka Streams

解決的問題

此倉儲庫提供了一種標準化的方法,用於衡量並比較 Pathway Live Data Framework 與其他業界標準的串流與批次資料處理引擎(如 Apache Flink、Apache Spark 和 Kafka Streams)的效能。它特別針對高吞吐量、低延遲的即時資料處理所需的可重現基準測試需求。

如何運作

該專案實作了兩個主要的基準測試套件:

  • WordCount 基準測試:透過從 Kafka 流讀取單詞並進行計數,衡量線上串流效能,並報告相對於吞吐量的 95% 延遲。
  • PageRank 基準測試:在三種模式下評估迭代式圖處理:批次、串流,以及「回填」(backfilling,一種混合模式,會在中途從批次處理切換至線上處理)。

這些基準測試在 Docker 容器中執行,以確保不同框架之間的資源限制(CPU 和記憶體)一致,並使用統一的 Python API 來操作 Pathway。

適用對象

  • 評估串流資料框架的資料工程師與架構師。
  • 比較 Rust 基底引擎與 JVM 基底引擎(如 Flink 和 Spark)效率的效能研究人員。
  • 希望在自家硬體上驗證 Pathway Live Data Framework 性能聲稱的使用者。

特色

  • 對比分析:直接將 Pathway 與 Flink、Spark 和 Kafka Streams 進行比較。
  • 混合工作負載:特別測試「回填」功能,衡量從批次處理切換至串流處理的能力。
  • 可重現環境:提供 Docker 化腳本與資料集存取(包含 Stanford LiveJournal 資料集),確保結果可被重複驗證。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案