datajuicer/data-juicer

Data processing for and with foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

解決する課題

Data-Juicerは、基盤モデルのデータセット準備時に直面する「生データの混乱」に対処します。乱雑で整理されていないデータを、事前学習、ファインチューニング、およびRAGアプリケーション向けの高品質でAI対応のインテリジェンスへと変換するための、スケーラブルで構成可能なインフラストラクチャを提供します。

仕組み

このシステムは、200以上のオペレーターによるモジュール式アーキテクチャを採用しており、これらをYAMLで定義された再現可能なパイプライン(レシピ)として連鎖させることができます。テキスト、画像、音声、ビデオ、およびマルチモーダルデータを含む様々なデータモダリティをサポートしています。大規模なワークロードに対しては、Rayのような分散実行フレームワークを活用し、数千のコアにわたって膨大なデータセットを処理します。

対象ユーザー

  • AI研究者: 高品質な事前学習またはファインチューニング用のコーパスを必要とする基盤モデルの開発者。
  • 機械学習エンジニア: インタラクション・トレースのクリーニングやコンテキストの構造化を必要とする、エージェント型システムやRAGパイプラインの開発者。
  • データサイエンティスト: カメラキャリブレーションやポーズ推定などの専門的な処理を必要とする、マルチモーダルデータ(ビデオ、音声など)を扱う専門家。

ハイライト

  • モジュール式アーキテクチャ: テキスト、画像、音声、ビデオ、およびマルチモーダルデータに対応する200以上のオペレーター。
  • スケーラブルなパフォーマンス: 6400コアのクラスター上で、2時間で700億のサンプルを処理可能。
  • レシピ駆動型: バージョン管理と共有が可能な、再現可能なYAMLパイプライン。
  • マルチモーダル対応: Embodied AI、ビデオ理解、およびセマンティックLLM抽出のための専用オペレーターを含む。
  • プロダクション対応: Alibaba Cloud PAIと統合されており、Rayによる分散実行をサポート。