datajuicer/data-juicer

Data processing for and with foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

解决的问题

Data-Juicer 解决了在为基础模型准备数据集时遇到的“原始数据混乱”问题。它提供了一个可扩展、可组合的基础设施,将杂乱无章的数据转换为用于预训练、微调和 RAG 应用的高质量、AI 就绪的智能数据。

工作原理

该系统采用由 200 多个算子(operator)组成的模块化架构,可以将它们链接成通过 YAML 定义的可复现流水线(recipe)。它支持包括文本、图像、音频、视频和多模态数据在内的多种数据模态。对于大规模工作负载,它利用 Ray 等分布式执行框架在数千个核心上处理海量数据集。

适用对象

  • AI 研究员:需要高质量预训练或微调语料库的基座模型构建者。
  • 机器学习工程师:需要清洗交互轨迹或构建上下文结构的智能体系统或 RAG 流水线开发者。
  • 数据科学家:处理多模态数据(视频、音频等)并需要相机标定或姿态估计等专业处理的用户。

亮点

  • 模块化架构:针对文本、图像、音频、视频和多模态数据的 200 多个算子。
  • 可扩展性能:在 6400 核集群上可在 2 小时内处理 700 亿个样本。
  • 配方驱动:可版本化和共享的可复现 YAML 流水线。
  • 多模态支持:包括用于具身智能(Embodied AI)、视频理解和语义 LLM 提取的专用算子。
  • 生产就绪:与 Alibaba Cloud PAI 集成,并支持通过 Ray 进行分布式执行。