NVIDIA-NeMo/Curator
Scalable data pre processing and curation toolkit for LLMs
解决的问题
NeMo Curator 解决了为 AI 训练准备大规模数据集的挑战。它用可重复的、GPU 加速的流水线取代了临时脚本和 Notebook,能够在多节点集群上处理数万亿个 Token 或海量多模态数据(文本、图像、视频和音频)。
工作原理
该系统采用基于 stages(阶段)和 executors(执行器)的模块化架构。每个阶段执行特定任务——例如加载、过滤、去重或转换数据——并声明其自身的资源需求。这些阶段被串联成流水线,并发流式传输任务,通过重叠 CPU 和 GPU 工作来最大化硬件利用率。生产环境默认使用 XennaExecutor,但也支持基于 Ray 的后端。它利用 NVIDIA RAPIDS (cuDF, cuML, cuGraph) 来实现高吞吐量并在 GPU 之间进行扩展。
适用对象
专为需要为大规模 AI 模型训练构建生产级数据策划流水线的 ML 工程师和数据团队设计,特别是那些使用 Nemotron 等 NVIDIA 训练工作流的用户。
亮点
- 多模态支持:为文本(去重、分类)、图像(美学/NSFW 过滤)、视频(场景检测、片段提取)和音频(ASR 转录、质量评估)提供现成的构建模块。
- GPU 加速:与基于 CPU 的替代方案相比,在模糊去重等数据密集型任务中实现了显著加速。
- 分布式执行:能够在单台笔记本电脑或跨多节点 Ray 或 Slurm 集群运行相同的流水线。
- 集成推理:包含用于流水线内合成数据生成 (SDG) 和分类的 OpenAI 兼容 LLM 端点。
- 大规模验证:为 NVIDIA Nemotron 模型提供数据流水线支持,处理超过 8 万亿个 Token。
相关
- 项目
- 项目
- 项目
- 项目
- 项目