facebookresearch/spdl
Scalable and Performant Data Loading
何を解決するか
大規模な配列データを処理するための、パフォーマンスが高くスケーラブルなデータ読み込みシステムの設計という課題に対処します。これは、機械学習パイプラインにおいてしばしばボトルネックとなります。
仕組み
SPDLは、柔軟なパイプライン抽象化と、配列データを効率的に処理するために設計された一連の専門的な操作を提供します。
対象者
AI/MLパイプラインのデータ読み込みおよび前処理段階を最適化し、高いパフォーマンスとスケーラブルなデータスループットを確保する必要がある研究者やエンジニア。
ハイライト
- スケーラブルでパフォーマンスの高いデータ読み込みアーキテクチャ
- データ処理のための柔軟なパイプライン抽象化
- 配列データの操作のための専門的な操作
関連
- プロジェクト
IBM/lalescikit-learn互換のパイプライン向けに、アルゴリズム選択とハイパーパラメータチューニングを自動化するPythonライブラリです。
- プロジェクト
google/seqioタスクベースのデータセット、前処理、評価を統一されたフレームワークで提供する、順序データ処理のためのライブラリ。
- プロジェクト
microsoft/FLAML最小限の計算リソースで高品質なモデルを見つけるための、効率的な自動化機械学習 (AutoML) およびハイパーパラメータチューニングのための軽量な Python ライブラリです。
- プロジェクト
aws/sagemaker-sparkスケーラブルなモデルトレーニングと DataFrame 上での推論を可能にする、オープンソースの Spark ライブラリで、Amazon SageMaker を Spark ML パイプラインに統合します。
- プロジェクト
bespokelabsai/curatorスケーラブルな合成データパイプラインを構築するための Python ライブラリで、バルク推論と構造化出力ツールを提供し、ポストトレーニング用の高品質データセットをキュレートします。