NVIDIA-NeMo/Curator
Scalable data pre processing and curation toolkit for LLMs
What it solves
NeMo Curator 解決了為 AI 訓練準備海量資料集的挑戰。它以可重複、GPU 加速的管線取代臨時腳本與 Notebook,能處理數兆 token 或大規模多模態資料,顯著降低資料清理、去重與過濾的時間與成本。
How it works
系統採用基於 stages 與 executors 的模組化架構。每個 stage 執行特定任務(如載入、過濾或轉換資料),並宣告自己的資源需求。這些 stage 被串接成管線,透過可插拔的 executor(如 XennaExecutor 或基於 Ray 的後端)進行任務串流。此串流方式讓 CPU 與 GPU 工作重疊,在使用 NVIDIA RAPIDS 的多節點、多 GPU 環境中保持 GPU 工作者的高利用率。
Who it’s for
它針對需要為文字、影像、影片與音訊資料集建構可擴展、產線級資料治理管線的機器學習工程師與資料團隊而設計。
Highlights
- Multimodal Support:提供即用的建構塊,支援文字(去重、語言偵測)、影像(美學過濾、NSFW 偵測)、影片(場景偵測、運動過濾)與音訊(ASR 轉寫、WER 過濾)。
- GPU Acceleration:利用 NVIDIA RAPIDS 與 Ray,實現大幅加速(例如相較於 CPU 方案,模糊去重快 16 倍)。
- Proven at Scale:為 NVIDIA Nemotron 系列模型提供資料管線支援,已完成 8 兆以上 token 的多語言網路資料治理。
- Flexible Deployment:可透過 Docker、Slurm 或 Kubernetes,在單機筆記本到多節點叢集的各種環境中執行。