OpenDCAI/DataFlow

Easy Data Preparation with latest LLMs-based Operators and Pipelines.

解决的问题

DataFlow 是一个以数据为中心的 AI 系统,旨在将噪声原始数据(如 PDF、纯文本和低质量 QA 对)转换为用于大语言模型 (LLM) 的高质量训练数据集。它解决了医疗、金融、法律和学术研究等领域中,手动数据清洗和合成所耗费的时间和成本问题。

工作原理

该系统采用“基于算子”的设计,将单个数据处理任务(生成、评估、过滤和精炼)封装为算子。随后,这些算子被编排成可复现且可共享的流水线。

核心组件包括:

  • Operators: 接收结构化输入 (JSON, JSONL, CSV) 并生成处理后输出的模块化单元。
  • Pipelines: 定义特定数据工作流(例如 Text, Reasoning, Text2SQL 和 Knowledge Base Cleaning)的算子序列。
  • DataFlow-WebUI: 一个可视化的低代码工作区,可以通过拖放或自然语言构建并运行这些流水线。
  • DataFlow-Agent: 一个智能助手,可以分析数据、编写自定义算子并自动组装流水线。

适用对象

DataFlow 专为需要大规模准备用于预训练 (Pre-training)、监督微调 (SFT)、RL 训练或 RAG 系统的优质数据的 AI 研究人员和企业而构建。

亮点

  • 低代码编排: 通过 WebUI 进行可视化流水线构建,实现更快的实验。
  • 开箱即用的流水线: 为文本、数学、代码和从 PDF 中提取结构化数据而预构建的工作流。
  • 类 PyTorch 结构: 采用 Pipeline $ ightarrow$ Operator $ ightarrow$ Prompt 的层级化组织方式,实现清晰的工作流控制。
  • 分布式扩展: 集成 RayOrch,实现大规模数据任务的高性能编排。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目