duoan/mega-data-factory
🏭 Mega Scale Multimodal DataPipeline for SOTA Foundation Models
解決的問題
Mega Data Factory 是一個高吞吐量的分佈式流水線,旨在處理 Web 規模的多模態數據集(數千億條記錄)。它透過提供過濾、評分和去重海量文本、圖像及影片數據的標準化方法,讓研究人員和開發人員能夠復現最先進的基座模型數據流水線——例如用於 FineWeb、RefinedWeb 和 LAION-5B 的流水線。
工作原理
該系統構建在 Ray 之上,採用將處理過程分為不同階段(CPU 和 GPU 池)的分佈式架構。它採用了流水線並行設計,使數據批次通過一系列「算子」(refiners、filters 和 deduplicators)。為了實現效能最大化,它在 CPU 密集型任務中使用 Rust 加速算子,在嵌入提取和評分中使用 GPU 優化算子。
適用對象
專為構建基座模型的 AI 研究人員和數據工程師設計,他們需要從跨多種模態的原始、嘈雜的 Web 規模數據中篩選出高品質的訓練集。
亮點
- 多模態支持:針對文本、圖像和影片的專用算子,包括 CLIP/SigLIP 嵌入提取。
- 高性能:使用 Rust 進行加速,並使用 vLLM 進行高吞吐量離線 LLM 合成。
- 可復現的方案:實現了 RefinedWeb 和 Z-Image 等主要論文中的特定過濾和評分邏輯。
- LLM 合成:集成支持在線(基於帳號/代理輪換的 API)和離線(本地 GPU)數據合成。
- 全面的報告:生成互動式 HTML 報告,包含數據品質漏斗和用於視覺化數據流的 Sankey 圖。
相關
- 專案
- 專案
- 專案
- 專案
- 專案