pathwaycom/pathway-benchmarks
Benchmarks for data processing systems: Pathway Live Data Framework, Spark, Flink, Kafka Streams
解決的問題
此倉儲庫提供了一種標準化的方法,用於衡量並比較 Pathway Live Data Framework 與其他業界標準的串流與批次資料處理引擎(如 Apache Flink、Apache Spark 和 Kafka Streams)的效能。它特別針對高吞吐量、低延遲的即時資料處理所需的可重現基準測試需求。
如何運作
該專案實作了兩個主要的基準測試套件:
- WordCount 基準測試:透過從 Kafka 流讀取單詞並進行計數,衡量線上串流效能,並報告相對於吞吐量的 95% 延遲。
- PageRank 基準測試:在三種模式下評估迭代式圖處理:批次、串流,以及「回填」(backfilling,一種混合模式,會在中途從批次處理切換至線上處理)。
這些基準測試在 Docker 容器中執行,以確保不同框架之間的資源限制(CPU 和記憶體)一致,並使用統一的 Python API 來操作 Pathway。
適用對象
- 評估串流資料框架的資料工程師與架構師。
- 比較 Rust 基底引擎與 JVM 基底引擎(如 Flink 和 Spark)效率的效能研究人員。
- 希望在自家硬體上驗證 Pathway Live Data Framework 性能聲稱的使用者。
特色
- 對比分析:直接將 Pathway 與 Flink、Spark 和 Kafka Streams 進行比較。
- 混合工作負載:特別測試「回填」功能,衡量從批次處理切換至串流處理的能力。
- 可重現環境:提供 Docker 化腳本與資料集存取(包含 Stanford LiveJournal 資料集),確保結果可被重複驗證。
相關
- 專案
- 專案
- 專案
- 專案
- 專案