NVIDIA-NeMo/RL

Scalable toolkit for efficient model reinforcement

🎯 什麼是 NeMo RL

NeMo RL 是 NVIDIA 的開源 後訓練強化學習庫,建構於更大的 NeMo 框架 之上。它讓您能將大型多模態模型(LLM、視覺-語言模型、MoE 模型等)以 GRPO、DPO、GDPO、DAPO 或策略內蒸餾等強化學習目標進行微調。重點在於 可擴展性 —— 您可執行單一 GPU 的快速實驗,或透過 PyTorch DTensor 或 NVIDIA 的 Megatron Core 啟動大型多節點、多 GPU 作業,利用高階平行化(張量、流水線、專家、FSDP2 等)。


🚀 核心功能(依據 README)

功能 詳細
演算法 GRPO/GSPO/DAPO、GDPO、LoRA 增強的 RL(GRPO、DPO)、監督式微調(SFT)、策略內蒸餾、多輪 RL、X‑Token 非策略蒸餾。
模型支援 主要 LLM 家族(Nemotron‑3、Qwen 3.5、Gemma 4、GLM 5.1、Minimax‑M3 等),包含密集型與 MoE 變體,以及視覺-語言模型。
訓練後端 DTensor – PyTorch 原生分散式訓練(TP、SP、PP、CP、FSDP2)。
Megatron Core – NVIDIA 的 6D 平行引擎,適用於最大規模模型。
生成/回放後端 vLLM(高吞吐量推論)與 Megatron 原生推論(無需權重轉換)。
效能特性 Muon 優化器、推測性解碼、FP8 低精度訓練、序列打包、長上下文(YARN)支援、非同步回放/重播緩衝區、基於 Ray 的資源編排、GB200 GPU 專用容器映像。
整合 Hugging Face 模型載入、NeMo‑Gym 環境支援、無縫 Docker/NGC 容器部署、豐富的 YAML 配方系統。
文件與工具 完整文件站、設計文件、範例設定、Google‑Colab 筆記本、CI 測試釋出、社群討論。

📚 常見使用情境

情境 NeMo RL 如何協助
對大型 LLM 進行對齊(例如 Nemotron‑3‑Ultra)透過 RLHF 風格訓練與人類偏好對齊 使用 GRPO/DAPO 配方,選擇後端(中等規模用 DTensor,>100 B 用 Megatron),在多節點 GPU 集群或提供的 NGC 容器上執行。
透過獎勵驅動微調改善視覺-語言模型 此庫支援 VLM,並提供適用於圖像-文字資料集的 GRPO 配方,利用相同的平行化基礎設施。
研究新 RL 演算法(例如 GDPO、X‑Token 蒸餾) 所有演算法皆以模組化元件呈現,您可在 YAML 設定中替換,並透過 grpo_smoke.yaml 快速執行煙霧測試。
在筆電或單一 GPU 上快速原型開發 原生 PyTorch(DTensor)路徑 無需 Megatron,Docker 快速啟動提供已安裝 vLLM 和 SGLang 的即用環境。
生產級 RL 服務 基於 Ray 的分散式訓練 + 非同步回放 + 容器映像,可從研究擴展至生產流程。

🛠️ 快速上手(摘要)

  1. 拉取官方容器(建議):
    docker pull nvcr.io/nvidia/nemo-rl:latest
    
  2. 克隆倉儲(含子模組):
    git clone --recursive https://github.com/NVIDIA-NeMo/RL.git nemo-rl
    cd nemo-rl
    
  3. 執行測試工作(選擇後端):
    • DTensor: uv run python examples/run_grpo.py
    • Megatron: uv run examples/run_grpo.py --config examples/configs/grpo_math_1B_megatron.yaml
  4. 擴展規模:編輯提供的 YAML 配方(GPU 數量、平行化旗標),使用 Ray 或 NGC 容器在多節點叢集上啟動。

📌 為何重要

NeMo RL 整合了 最新的基於 RL 的對齊演算法最尖端的大模型平行技術 以及 生產就緒工具(Docker、Ray、vLLM)。對於希望微調或對齊超大型 LLM/VLM 而無需從零建構分散式系統的人,NeMo RL 提供了一個單一、文件齊全的入口點。


TL;DR – NeMo RL 是一個真實、持續維護的 NVIDIA 庫,用於擴展大型多模態模型的強化學習後訓練,支援多種現代演算法、後端與硬體配置。

相關

  • 專案
  • Dispatch
  • Dispatch
  • 專案
  • 專案