NVIDIA-NeMo/Curator
Scalable data pre processing and curation toolkit for LLMs
解決的問題
NeMo Curator 解決了為 AI 訓練準備大規模數據集的挑戰。它用可重複的、GPU 加速的流水線取代了臨時腳本和 Notebook,能夠在多節點集群上處理數兆個 Token 或海量多模態數據(文本、圖像、影片和音訊)。
工作原理
該系統採用基於 stages(階段)和 executors(執行器)的模組化架構。每個階段執行特定任務——例如載入、過濾、去重或轉換數據——並聲明其自身的資源需求。這些階段被串聯成流水線,並行串流任務,透過重疊 CPU 和 GPU 工作來最大化硬體利用率。生產環境預設使用 XennaExecutor,但也支援基於 Ray 的後端。它利用 NVIDIA RAPIDS (cuDF, cuML, cuGraph) 來實現高吞吐量並在 GPU 之間進行擴展。
適用對象
專為需要為大規模 AI 模型訓練構建生產級數據策劃流水線的 ML 工程師和數據團隊設計,特別是那些使用 Nemotron 等 NVIDIA 訓練工作流的用戶。
亮點
- 多模態支援:為文本(去重、分類)、圖像(美學/NSFW 過濾)、影片(場景檢測、片段提取)和音訊(ASR 轉錄、品質評估)提供現成的構建模組。
- GPU 加速:與基於 CPU 的替代方案相比,在模糊去重等數據密集型任務中實現了顯著加速。
- 分散式執行:能夠在單台筆記型電腦或跨多節點 Ray 或 Slurm 集群執行相同的流水線。
- 整合推理:包含用於流水線內合成數據生成 (SDG) 和分類的 OpenAI 相容 LLM 端點。
- 大規模驗證:為 NVIDIA Nemotron 模型提供數據流水線支持,處理超過 8 兆個 Token。
相關
- 專案
- 專案
- 專案
- 專案
- 專案