quixio/quix-streams

Python Streaming DataFrames for Kafka

何を解決するか

Quix Streams は、Apache Kafka を使用してリアルタイムデータパイプラインおよびイベント駆動型マイクロサービスを構築するプロセスを簡素化します。複雑なサーバーサイドクラスターや Java ラッパーの必要性を排除し、純粋な Python でストリーミングデータに対する抽出(Extract)、変換(Transform)、ロード(Load)(ETL)操作を実行できるようにします。

動作方法

このフレームワークは、2つの主要なコンポーネントを使用しています。Application オブジェクトは Kafka 接続、メッセージのライフサイクル、およびコンシューマーグループによるスケーリングを管理し、StreamingDataFrame(SDF)は、受信メッセージを処理および変換するための宣言型パイプラインです。SDF を使用すると、Kafka のトピックを流れるデータに対して変換、フィルタリング、ウィンドウ処理などの操作を実行できます。

対象ユーザー

データエンジニア、Python 開発者、ML エンジニアで、Kafka ストリームに基づいた信頼性がありスケーラブルなリアルタイムデータ処理システムや AI/ML プロダクトを構築したい方におすすめです。

特徴

  • 純粋な Python:Java ラッパーまたはクロスランゲージのデバッグは不要です。
  • ストリーミング DataFrame API:パイプライン構築に向けた表形式データ処理アプローチを提供します。
  • 正確に一度の処理:Kafka トランザクションにより保証され、データの信頼性が確保されます。
  • 障害に強い状態保持操作:自動チェックポイント機能により、状態保持処理が可能で、耐障害性が向上します。
  • 広範な統合:JSON、Avro、Protobuf 用の Serializers API と、カスタムソースおよびシンク用の専用 API を提供します。
  • ストリーミング結合とウィンドウ処理:グループ化や分岐などの複雑なイベント処理タスクに向けた組み込み演算子があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト