pathwaycom/pathway-benchmarks

Benchmarks for data processing systems: Pathway Live Data Framework, Spark, Flink, Kafka Streams

它解决了什么问题

此仓库提供了一种标准化的方法,用于衡量和比较 Pathway 实时数据框架与其他行业标准流式和批处理数据处理引擎(如 Apache Flink、Apache Spark 和 Kafka Streams)的性能。它特别解决了对高吞吐量、低延迟实时数据处理的可复现基准测试的需求。

它如何工作

该项目实现了两个主要的基准测试套件:

  • WordCount 基准测试:通过从 Kafka 流中读取单词并进行计数,衡量在线流式处理性能,并报告相对于吞吐量的 95% 延迟。
  • PageRank 基准测试:在三种模式下评估迭代图处理:批处理、流式处理以及“回填”(一种混合模式,中途从批处理切换到在线处理)。

这些基准测试在 Docker 容器中执行,以确保不同框架之间资源限制(CPU 和内存)的一致性,并使用统一的 Python API 来调用 Pathway。

适用对象

  • 正在评估流式数据框架的数据工程师和架构师。
  • 比较基于 Rust 的引擎与基于 JVM 的引擎(如 Flink 和 Spark)效率的性能研究人员。
  • 希望在自己硬件上验证 Pathway 实时数据框架性能声明的用户。

亮点

  • 对比分析:直接将 Pathway 与 Flink、Spark 和 Kafka Streams 进行对比。
  • 混合工作负载:特别测试“回填”能力,衡量从批处理切换到流式处理的能力。
  • 可复现环境:提供 Docker 化脚本和数据集访问(包括 Stanford LiveJournal 数据集),确保结果可复现。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目