duoan/mega-data-factory
🏭 Mega Scale Multimodal DataPipeline for SOTA Foundation Models
解决的问题
Mega Data Factory 是一个高吞吐量的分布式流水线,旨在处理 Web 规模的多模态数据集(数千亿条记录)。它通过提供过滤、评分和去重海量文本、图像及视频数据的标准化方法,让研究人员和开发人员能够复现最先进的基座模型数据流水线——例如用于 FineWeb、RefinedWeb 和 LAION-5B 的流水线。
工作原理
该系统构建在 Ray 之上,采用将处理过程分为不同阶段(CPU 和 GPU 池)的分布式架构。它采用了流水线并行设计,使数据批次通过一系列“算子”(refiners、filters 和 deduplicators)。为了实现性能最大化,它在 CPU 密集型任务中使用 Rust 加速算子,在嵌入提取和评分中使用 GPU 优化算子。
适用对象
专为构建基座模型的 AI 研究人员和数据工程师设计,他们需要从跨多种模态的原始、嘈杂的 Web 规模数据中筛选出高质量的训练集。
亮点
- 多模态支持:针对文本、图像和视频的专用算子,包括 CLIP/SigLIP 嵌入提取。
- 高性能:使用 Rust 进行加速,并使用 vLLM 进行高吞吐量离线 LLM 合成。
- 可复现的方案:实现了 RefinedWeb 和 Z-Image 等主要论文中的特定过滤和评分逻辑。
- LLM 合成:集成支持在线(基于账号/代理轮换的 API)和离线(本地 GPU)数据合成。
- 全面的报告:生成交互式 HTML 报告,包含数据质量漏斗和用于可视化数据流的 Sankey 图。
相关
- 项目
- 项目
- 项目
- 项目
- 项目