duoan/mega-data-factory
🏭 Mega Scale Multimodal DataPipeline for SOTA Foundation Models
解決する課題
Mega Data Factoryは、Web規模のマルチモーダルデータセット(数千億件のレコード)を処理するために設計された、高スループットの分散型パイプラインです。FineWeb、RefinedWeb、LAION-5Bなどで使用されているような最先端の基盤モデルデータパイプラインを再現できるように、大量のテキスト、画像、ビデオデータをフィルタリング、スコアリング、重複排除するための標準化された方法を提供します。
仕組み
Ray上に構築されたこのシステムは、処理をステージ(CPUおよびGPUプール)に分離する分散アーキテクチャを採用しています。データバッチが一連の「オペレーター」(リファイナー、フィルター、重複排除器)を通過するパイプライン並列設計を採用しています。パフォーマンスを最大化するために、CPU負荷の高いタスクにはRustで加速されたオペレーターを、埋め込み抽出とスコアリングにはGPUに最適化されたオペレーターを使用します。
対象者
複数のモダリティにわたる、ノイズの多い生のWeb規模データから高品質なトレーニングセットをキュレーションする必要がある、基盤モデルを構築するAI研究者やデータエンジニア向けに設計されています。
ハイライト
- マルチモーダル対応: テキスト、画像、ビデオ専用のオペレーター(CLIP/SigLIPの埋め込み抽出を含む)。
- 高いパフォーマンス: 加速にRustを使用し、高スループットなオフラインLLM合成にvLLMを使用。
- 再現可能なレシピ: RefinedWebやZ-Imageなどの主要な論文の特定のフィルタリングおよびスコアリングロジックを実装。
- LLM合成: オンライン(アカウント/プロキシローテーションを伴うAPIベース)とオフライン(ローカルGPU)の両方のデータ合成を統合サポート。
- 包括的なレポート: データフローを可視化するためのデータ品質ファネルとSankey図を含む、インタラクティブなHTMLレポートを生成。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト