NVIDIA-NeMo/RL

Scalable toolkit for efficient model reinforcement

🎯 什么是 NeMo RL

NeMo RL 是 NVIDIA 的开源 后训练强化学习库,基于更大的 NeMo 框架 构建。它允许您对大型多模态模型(LLM、视觉-语言模型、MoE 模型等)进行基于 RL 的目标微调,例如 GRPO、DPO、GDPO、DAPO 或策略内蒸馏。重点在于 可扩展性 —— 您可以在单 GPU 上快速运行实验,也可以通过 PyTorch DTensor 或 NVIDIA 的 Megatron Core 启动大规模多节点、多 GPU 任务,利用高级并行化(张量、流水线、专家、FSDP2 等)。


🚀 核心功能(基于 README)

功能 详情
算法 GRPO/GSPO/DAPO、GDPO、LoRA 增强的 RL(GRPO、DPO)、监督微调(SFT)、策略内蒸馏、多轮 RL、X‑Token 非策略蒸馏。
模型支持 主要 LLM 家族(Nemotron‑3、Qwen 3.5、Gemma 4、GLM 5.1、Minimax‑M3 等),包括密集型和 MoE 变体,以及视觉-语言模型。
训练后端 DTensor – PyTorch 原生分布式训练(TP、SP、PP、CP、FSDP2)。
Megatron Core – NVIDIA 的 6D 并行引擎,适用于最大规模模型。
生成/回放后端 vLLM(高吞吐量推理)和 Megatron 原生推理(无需权重转换)。
性能特性 Muon 优化器、推测性解码、FP8 低精度训练、序列打包、长上下文(YARN)支持、异步回放/重放缓冲区、基于 Ray 的资源编排、GB200 GPU 专用容器镜像。
集成 Hugging Face 模型加载、NeMo‑Gym 环境支持、无缝 Docker/NGC 容器部署、丰富的 YAML 配置系统。
文档与工具 完整文档站、设计文档、示例配置、Google‑Colab 笔记本、CI 测试发布、社区讨论。

📚 典型应用场景

场景 NeMo RL 如何帮助
对大型 LLM 进行对齐(例如 Nemotron‑3‑Ultra)通过 RLHF 风格训练与人类偏好对齐 使用 GRPO/DAPO 配置,选择后端(中等规模用 DTensor,>100 B 用 Megatron),在多节点 GPU 集群或提供的 NGC 容器上运行。
通过奖励驱动微调改进视觉-语言模型 该库支持 VLM,并提供适用于图像-文本数据集的 GRPO 配置,利用相同的并行化基础设施。
研究新 RL 算法(例如 GDPO、X‑Token 蒸馏) 所有算法均作为模块化组件暴露,您可在 YAML 配置中替换,并通过 grpo_smoke.yaml 快速运行烟雾测试。
在笔记本电脑或单 GPU 上快速原型开发 原生 PyTorch(DTensor)路径 无需 Megatron,Docker 快速启动提供已安装 vLLM 和 SGLang 的即用环境。
生产级 RL 服务 基于 Ray 的分布式训练 + 异步回放 + 容器镜像,可从研究扩展到生产流水线。

🛠️ 快速入门(摘要)

  1. 拉取官方容器(推荐):
    docker pull nvcr.io/nvidia/nemo-rl:latest
    
  2. 克隆仓库(包含子模块):
    git clone --recursive https://github.com/NVIDIA-NeMo/RL.git nemo-rl
    cd nemo-rl
    
  3. 运行测试任务(选择后端):
    • DTensor: uv run python examples/run_grpo.py
    • Megatron: uv run examples/run_grpo.py --config examples/configs/grpo_math_1B_megatron.yaml
  4. 扩展规模:编辑提供的 YAML 配置(GPU 数量、并行化标志),使用 Ray 或 NGC 容器在多节点集群上启动。

📌 为何重要

NeMo RL 集成了 最新的基于 RL 的对齐算法最先进的大模型并行技术 以及 生产就绪工具(Docker、Ray、vLLM)。对于希望微调或对齐超大规模 LLM/VLM 而无需从零构建分布式系统的人,NeMo RL 提供了一个单一、文档齐全的入口点。


TL;DR – NeMo RL 是一个真实、持续维护的 NVIDIA 库,用于扩展大规模多模态模型的强化学习后训练,支持多种现代算法、后端和硬件配置。

相关

  • 项目
  • Dispatch
  • Dispatch
  • 项目
  • 项目