datajuicer/data-juicer
Data processing for and with foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
解决的问题
Data-Juicer 是一个全面的数据处理系统,旨在将原始、混乱的数据转换为高质量、AI 就绪的数据集。它解决了为基础模型准备大规模数据的挑战,包括跨多种模态(文本、图像、音频、视频)的清理、去重和合成。
工作原理
该系统将数据处理视为可组合的基础设施。它采用模块化架构,包含超过 200 个算子,这些算子可以串联成可复现的流水线,并通过 YAML 配方进行定义。这些流水线可以从单台笔记本电脑扩展到千节点集群,使用 Ray 进行分布式执行,并具备自动算子融合和 CUDA 加速等优化功能,以处理 PB 级的数据集。
适用人群
它专为需要策划预训练语料库、准备微调或 RL 数据、清理智能体交互轨迹,或构建特定领域 RAG 索引的 AI 研究人员和工程师而打造。
亮点
- 多模态支持:用于文本、图像、音频、视频和具身 AI (VLA) 数据的算子。
- 配方优先的工作流:可复现的基于 YAML 的流水线,可进行版本控制与共享。
- 云原生扩展:与 Ray 深度集成,对数十亿个样本进行高性能分布式处理。
- 丰富的算子库:超过 200 个内置算子,用于过滤、映射和分析。
- Juicer 模型:一个可本地部署的数据精炼模型,遵循自然语言指令进行清理和标注。
相关
- 项目
- 项目
- 项目
- 项目
- 项目