pathwaycom/pathway-benchmarks
Benchmarks for data processing systems: Pathway Live Data Framework, Spark, Flink, Kafka Streams
它解决了什么问题
此仓库提供了一种标准化的方法,用于衡量和比较 Pathway 实时数据框架与其他行业标准流式和批处理数据处理引擎(如 Apache Flink、Apache Spark 和 Kafka Streams)的性能。它特别解决了对高吞吐量、低延迟实时数据处理的可复现基准测试的需求。
它如何工作
该项目实现了两个主要的基准测试套件:
- WordCount 基准测试:通过从 Kafka 流中读取单词并进行计数,衡量在线流式处理性能,并报告相对于吞吐量的 95% 延迟。
- PageRank 基准测试:在三种模式下评估迭代图处理:批处理、流式处理以及“回填”(一种混合模式,中途从批处理切换到在线处理)。
这些基准测试在 Docker 容器中执行,以确保不同框架之间资源限制(CPU 和内存)的一致性,并使用统一的 Python API 来调用 Pathway。
适用对象
- 正在评估流式数据框架的数据工程师和架构师。
- 比较基于 Rust 的引擎与基于 JVM 的引擎(如 Flink 和 Spark)效率的性能研究人员。
- 希望在自己硬件上验证 Pathway 实时数据框架性能声明的用户。
亮点
- 对比分析:直接将 Pathway 与 Flink、Spark 和 Kafka Streams 进行对比。
- 混合工作负载:特别测试“回填”能力,衡量从批处理切换到流式处理的能力。
- 可复现环境:提供 Docker 化脚本和数据集访问(包括 Stanford LiveJournal 数据集),确保结果可复现。
相关
- 项目
- 项目
- 项目
- 项目
- 项目