NVIDIA-NeMo/Curator

Scalable data pre processing and curation toolkit for LLMs

What it solves

NeMo Curator 解决了为 AI 训练准备大规模数据集的挑战。它用可重复的、GPU 加速的流水线取代了临时脚本和 notebook,这些流水线可以从单台笔记本电脑扩展到多节点集群,通过过滤、去重和转换来确保高质量数据。

How it works

该系统采用基于stages(离散任务,如加载、过滤或分类)和executors(运行时环境)的模块化架构。

  • Pipeline Composition: Stages 被串联在一起,executor 会自动扩展副本以维持吞吐量。
  • Streaming Execution: 它通过重叠 CPU 和 GPU 工作负载来保持 GPU 的高利用率(通常 >99%)。
  • Modality Support: 它为文本、图像、视频和音频数据提供专门的构建块。
  • Distributed Scaling: 它利用 NVIDIA RAPIDS (cuDF, cuML, cuGraph) 和 Ray 来将工作负载分布到多个 GPU 和节点上。

Who it’s for

需要处理万亿级 token 规模的数据集或多模态数据(图像、视频、音频)以训练前沿 AI 模型的机器学习工程师和数据团队。

Highlights

  • Multimodal Capabilities: 专门用于文本(去重、语言检测)、图像(美学/NSFW 过滤)、视频(场景检测、运动过滤)和音频(ASR 转录、WER 过滤)的流水线。
  • GPU Acceleration: 相比基于 CPU 的替代方案有显著的速度提升,例如将模糊去重时间从 10.7 小时减少到 0.65 小时。
  • Production Proven: 为 NVIDIA Nemotron 模型的数据流水线提供支持,包括对 8+ 万亿 token 的网络数据进行整理。
  • Synthetic Data Generation: 包括一个与 OpenAI 兼容的推理服务器,以促进流水线内的 SDG 和分类工作流。