NVIDIA-NeMo/RL

Scalable toolkit for efficient model reinforcement

🎯 NeMo RL 는 무엇인가요?

NeMo RL은 NVIDIA의 오픈소스 포스트 트레이닝 강화학습 라이브러리로, 더 큰 NeMo 프레임워크 위에 구축되었습니다. 대규모 멀티모달 모델(LLM, 비전-언어 모델, MoE 모델 등)을 GRPO, DPO, GDPO, DAPO 또는 온폴리시 디스틸레이션 기반의 강화학습 목표로 파인튜닝할 수 있습니다. 핵심은 확장성이며, 단일 GPU 실험부터 PyTorch DTensor 또는 NVIDIA의 Megatron Core를 통해 고급 병렬 처리(Tensor, Pipeline, Expert, FSDP2 등)를 활용한 다중 노드, 다중 GPU 대규모 작업까지 실행 가능합니다.


🚀 주요 기능 (README 기준)

기능 세부 사항
알고리즘 GRPO/GSPO/DAPO, GDPO, LoRA 강화된 RL (GRPO, DPO), 지도 기반 파인튜닝(SFT), 온폴리시 디스틸레이션, 다중 턴 RL, X‑Token 비폴리시 디스틸레이션.
모델 지원 주요 LLM 패밀리(Nemotron‑3, Qwen 3.5, Gemma 4, GLM 5.1, Minimax‑M3 등), 밀도형 및 MoE 버전, 비전-언어 모델 포함.
학습 백엔드 DTensor – PyTorch 네이티브 분산 학습(TP, SP, PP, CP, FSDP2).
Megatron Core – 가장 큰 모델을 위한 NVIDIA의 6차원 병렬 처리 엔진.
생성/롤아웃 백엔드 vLLM (고처리량 추론) 및 Megatron-네이티브 추론 (가중치 변환 없음).
성능 기능 Muon 최적화기, 사전 추론, FP8 저정밀도 학습, 시퀀스 패킹, 긴 컨텍스트(YARN) 지원, 비동기 롤아웃/재생 버퍼, Ray 기반 리소스 오케스트레이션, GB200 GPU용 컨테이너 이미지.
통합 Hugging Face 모델 로딩, NeMo‑Gym 환경 지원, Docker/NGC 컨테이너 배포의 원활한 통합, 풍부한 YAML 기반 레시피 시스템.
문서 및 도구 완전한 문서 사이트, 설계 문서, 예제 설정, Google‑Colab 노트북, CI 테스트 리リ스, 커뮤니티 토론.

📚 일반적인 사용 사례

시나리오 NeMo RL이 어떻게 도움이 되는가
대규모 LLM의 인간 선호도에 맞추기 (예: Nemotron‑3‑Ultra) RLHF 스타일 학습 GRPO/DAPO 레시피 사용, 백엔드 선택(DTensor는 중간 규모, Megatron은 100B 이상), 다중 노드 GPU 클러스터 또는 제공된 NGC 컨테이너에서 실행.
비전-언어 모델의 보상 기반 파인튜닝으로 개선 라이브러리가 VLM을 지원하며, 이미지-텍스트 데이터셋과 함께 작동하는 GRPO 레시피 제공. 동일한 병렬 처리 인프라 활용.
새로운 RL 알고리즘 연구 (예: GDPO, X‑Token 디스틸레이션) 모든 알고리즘은 모듈형 컴포넌트로 노출되며, YAML 설정에서 쉽게 교체 가능하고 grpo_smoke.yaml로 빠른 스모크 테스트 가능.
노트북 또는 단일 GPU에서 빠른 프로토타이핑 네이티브 PyTorch (DTensor) 경로 는 Megatron 없이 작동하며, Docker 빠른 시작으로 vLLM과 SGLang이 미리 설치된 실행 환경 제공.
생산 규모의 RL 서빙 Ray 기반 분산 학습 + 비동기 롤아웃 + 컨테이너 이미지로 연구에서 생산 파이프라인까지 확장 가능.

🛠️ 시작하기 (요약)

  1. 공식 컨테이너 가져오기 (권장):
    docker pull nvcr.io/nvidia/nemo-rl:latest
    
  2. 리포지토리 클론 (하위 모듈 포함):
    git clone --recursive https://github.com/NVIDIA-NeMo/RL.git nemo-rl
    cd nemo-rl
    
  3. 테스트 작업 실행 (백엔드 선택):
    • DTensor: uv run python examples/run_grpo.py
    • Megatron: uv run examples/run_grpo.py --config examples/configs/grpo_math_1B_megatron.yaml
  4. 확장 – 제공된 YAML 레시피를 편집하여 GPU 수, 병렬화 플래그를 조정하고 Ray 또는 NGC 컨테이너를 통해 다중 노드 클러스터에서 실행.

📌 왜 중요한가요?

NeMo RL은 최신의 RL 기반 아라이어먼트 알고리즘, 최첨단 대규모 모델 병렬 처리, 그리고 생산 준비 도구(Docker, Ray, vLLM)를 통합합니다. 대규모 LLM/VLM을 파인튜닝하거나 아라이어먼트하려는 사용자에게, 분산 스택을 처음부터 구축하지 않아도 되는 단일하고 잘 문서화된 진입점 제공합니다.


TL;DR – NeMo RL은 다양한 현대적 알고리즘, 백엔드, 하드웨어 구성 지원하는 진정한, 활발히 유지 관리되는 NVIDIA 라이브러리로, 대규모 멀티모달 모델의 강화학습 포스트 트레이닝을 확장 가능한 방식으로 가능하게 합니다.

관련

  • 프로젝트
  • Dispatch
  • Dispatch
  • 프로젝트
  • 프로젝트