datajuicer/data-juicer

Data processing for and with foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

解決する課題

Data-Juicer は、生の無秩序なデータを高品質で AI 対応のデータセットに変換するために設計された包括的なデータ処理システムです。基盤モデル向けの大規模データ準備という課題、具体的には複数のモダリティ(テキスト、画像、音声、動画)にわたるクリーニング、重複排除、合成に対処します。

仕組み

このシステムは、データ処理を構成可能なインフラストラクチャとして扱います。200以上の演算子を備えたモジュラーアーキテクチャを採用し、これらを YAML レシピで定義された再現可能なパイプラインとして連鎖させることができます。これらのパイプラインは、分散実行のために Ray を使用して、単一のラップトップから千ノードのクラスターへとスケールすることができます。また、ペタバイト規模のデータセットを処理するための自動演算子融合や CUDA アクセラレーションなどの最適化も備えています。

対象者

事前学習コーパスのキュレーション、ファインチューニングや RL データの準備、エージェントの相互作用トレースのクリーニング、またはドメイン固有の RAG インデックスの構築を行う必要がある AI 研究者やエンジニア向けに構築されています。

ハイライト

  • マルチモーダルサポート: テキスト、画像、音声、動画、および身体性 AI (VLA) データ向けの演算子。
  • レシピファーストのワークフロー: バージョン管理と共有が可能な、YAML ベースの再現可能なパイプライン。
  • クラウドネイティブなスケーリング: 数十億のサンプルの高性能分散処理を実現する Ray との深い統合。
  • 豊富な演算子群: フィルタリング、マッピング、分析のための200以上の組み込み演算子。
  • Juicer モデル: クリーニングとラベリングのための自然言語の指示に従う、ローカルデプロイ可能なデータ精製モデル。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト