NVIDIA-NeMo/Curator

Scalable data pre processing and curation toolkit for LLMs

What it solves

NeMo Curator 解決了為 AI 訓練準備海量資料集的挑戰。它以可重複、GPU 加速的管線取代臨時腳本與 Notebook,能處理數兆 token 或大規模多模態資料,顯著降低資料清理、去重與過濾的時間與成本。

How it works

系統採用基於 stagesexecutors 的模組化架構。每個 stage 執行特定任務(如載入、過濾或轉換資料),並宣告自己的資源需求。這些 stage 被串接成管線,透過可插拔的 executor(如 XennaExecutor 或基於 Ray 的後端)進行任務串流。此串流方式讓 CPU 與 GPU 工作重疊,在使用 NVIDIA RAPIDS 的多節點、多 GPU 環境中保持 GPU 工作者的高利用率。

Who it’s for

它針對需要為文字、影像、影片與音訊資料集建構可擴展、產線級資料治理管線的機器學習工程師與資料團隊而設計。

Highlights

  • Multimodal Support:提供即用的建構塊,支援文字(去重、語言偵測)、影像(美學過濾、NSFW 偵測)、影片(場景偵測、運動過濾)與音訊(ASR 轉寫、WER 過濾)。
  • GPU Acceleration:利用 NVIDIA RAPIDS 與 Ray,實現大幅加速(例如相較於 CPU 方案,模糊去重快 16 倍)。
  • Proven at Scale:為 NVIDIA Nemotron 系列模型提供資料管線支援,已完成 8 兆以上 token 的多語言網路資料治理。
  • Flexible Deployment:可透過 Docker、Slurm 或 Kubernetes,在單機筆記本到多節點叢集的各種環境中執行。