pathwaycom/pathway-benchmarks

Benchmarks for data processing systems: Pathway Live Data Framework, Spark, Flink, Kafka Streams

解消する課題

このリポジトリは、Pathway Live Data Frameworkのパフォーマンスを、Apache Flink、Apache Spark、Kafka Streamsといった業界標準のストリーミングおよびバッチデータ処理エンジンと比較・測定するための標準化された手法を提供します。特に、高スループットかつ低レイテンシなリアルタイムデータ処理における、再現可能なベンチマークの必要性に対応しています。

仕組み

このプロジェクトは、主に2つのベンチマークスイートを実装しています:

  • WordCount Benchmark: Kafkaストリームから単語を読み取ってカウントし、スループットに対する95%レイテンシを報告することで、オンラインストリーミングのパフォーマンスを測定します。
  • PageRank Benchmark: バッチ、ストリーミング、および「backfilling」(バッチからオンライン処理へ途中で切り替えるハイブリッドモード)の3つのモードにわたって、反復的なグラフ処理を評価します。

これらのベンチマークは、異なるフレームワーク間で一貫したリソース制限(CPUおよびRAM)を確保するためにDockerコンテナ内で実行され、Pathway用の統一されたPython APIを使用します。

対象ユーザー

  • ストリーミングデータフレームワークを評価しているデータエンジニアおよびアーキテクト。
  • RustベースのエンジンとJVMベースのエンジン(FlinkやSparkなど)の効率性を比較しているパフォーマンス研究者。
  • 自身のハードウェア上でPathway Live Data Frameworkのパフォーマンスに関する主張を検証したいPathway Live Data Frameworkのユーザー。

ハイライト

  • 比較分析: PathwayをFlink、Spark、Kafka Streamsと直接比較します。
  • ハイブリッドワークロード: 特に「backfilling」機能をテストし、バッチ処理からストリーミング処理への移行能力を測定します。
  • 再現可能な環境: 結果を再現できるように、Docker化されたスクリプトとデータセットへのアクセス(Stanford LiveJournalデータセットを含む)を提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト