NVIDIA-NeMo/Curator

Scalable data pre processing and curation toolkit for LLMs

What it solves

NeMo Curator は、AI トレーニング用の膨大なデータセットの準備という課題に対処します。アドホックなスクリプトやノートブックを、単一のノートパソコンからマルチノード・クラスターまでスケール可能な、繰り返し可能な GPU 加速パイプラインに置き換え、フィルタリング、重複排除、および変換を通じて高品質なデータを保証します。

How it works

このシステムは、stages(ロード、フィルタリング、または分類などの個別のタスク)と executors(ランタイム環境)に基づいたモジュール式アーキテクチャを使用します。

  • Pipeline Composition: Stages はチェーン化され、executor はスループットを維持するためにレプリカを自動的にスケールします。
  • Streaming Execution: CPU と GPU のワークロードをオーバーラップさせることで、GPU の利用率を高く維持します(多くの場合 >99%)。
  • Modality Support: テキスト、画像、ビデオ、およびオーディオ・データ用の専門的なビルディングブロックを提供します。
  • Distributed Scaling: NVIDIA RAPIDS (cuDF, cuML, cuGraph) と Ray を活用して、ワークロードを複数の GPU とノードに分散させます。

Who it’s for

フロンティア AI モデルのトレーニング用に、兆単位のトークン規模のデータセットやマルチモーダル・データ(画像、ビデオ、オーディオ)を処理する必要がある ML エンジニアおよびデータチーム。

Highlights

  • Multimodal Capabilities: テキスト(重複排除、言語検出)、画像(aesthetic/NSFW フィルタリング)、ビデオ(シーン検出、motion フィルタリング)、およびオーディオ(ASR 転記、WER フィルタリング)用の専用パイプライン。
  • GPU Acceleration: CPU ベースの代替手段と比較して大幅な高速化を実現します。例えば、fuzzy deduplication の時間を 10.7 時間から 0.65 時間に短縮します。
  • Production Proven: 8 兆を超えるウェブ・データのトークンをキュレーションした NVIDIA Nemotron モデルのデータ・パイプラインを支えています。
  • Synthetic Data Generation: パイプライン内での SDG と分類ワークフローを促進するために、OpenAI 互換の推論サーバーが含まれています。