pathwaycom/pathway-benchmarks
Benchmarks for data processing systems: Pathway Live Data Framework, Spark, Flink, Kafka Streams
解消する課題
このリポジトリは、Pathway Live Data Frameworkのパフォーマンスを、Apache Flink、Apache Spark、Kafka Streamsといった業界標準のストリーミングおよびバッチデータ処理エンジンと比較・測定するための標準化された手法を提供します。特に、高スループットかつ低レイテンシなリアルタイムデータ処理における、再現可能なベンチマークの必要性に対応しています。
仕組み
このプロジェクトは、主に2つのベンチマークスイートを実装しています:
- WordCount Benchmark: Kafkaストリームから単語を読み取ってカウントし、スループットに対する95%レイテンシを報告することで、オンラインストリーミングのパフォーマンスを測定します。
- PageRank Benchmark: バッチ、ストリーミング、および「backfilling」(バッチからオンライン処理へ途中で切り替えるハイブリッドモード)の3つのモードにわたって、反復的なグラフ処理を評価します。
これらのベンチマークは、異なるフレームワーク間で一貫したリソース制限(CPUおよびRAM)を確保するためにDockerコンテナ内で実行され、Pathway用の統一されたPython APIを使用します。
対象ユーザー
- ストリーミングデータフレームワークを評価しているデータエンジニアおよびアーキテクト。
- RustベースのエンジンとJVMベースのエンジン(FlinkやSparkなど)の効率性を比較しているパフォーマンス研究者。
- 自身のハードウェア上でPathway Live Data Frameworkのパフォーマンスに関する主張を検証したいPathway Live Data Frameworkのユーザー。
ハイライト
- 比較分析: PathwayをFlink、Spark、Kafka Streamsと直接比較します。
- ハイブリッドワークロード: 特に「backfilling」機能をテストし、バッチ処理からストリーミング処理への移行能力を測定します。
- 再現可能な環境: 結果を再現できるように、Docker化されたスクリプトとデータセットへのアクセス(Stanford LiveJournalデータセットを含む)を提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト