Alluxio/alluxio

Alluxio, data orchestration for analytics and machine learning in the cloud

What it solves

Alluxio は、計算フレームワークとストレージシステムの間のギャップを埋めるために設計された分散型キャッシュプラットフォームです。多数のストレージシステムに接続するための共通インターフェースを提供することで、データアクセスレイテンシと断片化の問題を解決し、データ集約型計算エンジンを効果的に加速させます。

How it works

Alluxio は、ストレージシステムと計算フレームワークの間にキャッシュ層を提供する仮想分散型ファイルシステムとして機能します。データを計算側にローカルキャッシュすることで、計算機へのデータアクセスを高速化し、アプリケーションが統一インターフェースを通じてさまざまなストレージバックエンドに接続できるようにします。これにより、複数のストレージシステムの管理に伴う「接着剤」(glue) の役割と複雑さが増大するのを防ぎます。

Who it’s for

主に、大規模なデータ分析ワークロードや、Presto、Spark、Trino といったデータ集約型計算エンジンを使用する開発者やデータエンジニア向けです。

Highlights

  • 大規模データの分散型キャッシュ。
  • 複数のストレージシステムに対する統一インターフェース。
  • 構造化データ分析用に特化設計。
  • オープンソース版では最大 1 億個のファイルを管理可能。
  • Spark、Presto、Trino といった計算エンジンとの統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト