data-prep-kit/data-prep-kit

Open source project for data preparation for GenAI applications

解决的问题

Data-Prep-Kit 简化了为大型语言模型(LLMs)准备非结构化数据的复杂过程。它提供了一种可扩展的方法,用于清理、转换和丰富用于预训练、微调、指令微调或构建检索增强生成(RAG)应用的数据。

工作原理

该工具包由一个不断增长的模块化转换库组成,可应用于自然语言、代码和图像。这些转换基于 Python 和 Ray 构建,使处理过程可从单台笔记本电脑扩展到整个数据中心。该框架支持 Parquet、ZIP、NDJSON 和 JSONL 等多种文件格式。对于复杂的工作流,转换可以作为作业部署在 Kubernetes 集群上,或使用 Tekton 管道进行编排。

适用人群

需要处理大量非结构化数据以用于模型训练或 RAG 流水线的 LLM 应用开发者。

主要亮点

  • 多模态支持:处理自然语言、代码和图像数据。
  • 可扩展架构:支持 Python 仅运行时和 Ray 运行时,实现大规模扩展。
  • 模块化转换库:包含数据摄入(如 HTML 转 Parquet)、去重(精确和模糊)、质量标注、PII 信息脱敏和语言识别等工具。
  • 企业级部署:与 Kubernetes 和 Tekton 管道兼容,支持自动化。

相关

  • 项目
  • 项目
  • 项目
  • 项目