NVIDIA-NeMo/Nemotron

Developer Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models

해결하는 문제

Nemotron은 에이전트형 AI를 구축하기 위해 필요한 오픈소스이자 고효율의 다중모달 모델과 완전한 트레이닝 인프라를 제공합니다. 생산 수준의 LLM 트레이닝을 재현하는 어려움을 해결하기 위해, 단순한 예시가 아니라 원시 데이터 커리레이션 및 합성 데이터 생성부터 지도 미세조정(SFT), 강화학습(RL)에 이르기까지 완전한 파이프라인을 제공합니다.

작동 방식

이 프로젝트는 재사용 가능한 '스텝'(작업 단위)과 완전한 '레시피'(파이프라인)로 구성되어 있습니다. 시퀀스 효율성과 추론 능력의 균형을 위해 하이브리드 Mamba-Transformer Mixture-of-Experts (MoE) 아키텍처를 사용합니다. 생태계는 NVIDIA의 스택과 통합되어 있으며, 트레이닝에는 Megatron-Bridge, 강화학습에는 NeMo-RL, 최적화된 배포에는 TensorRT-LLM이 활용됩니다.

대상 사용자

에이전트 워크플로우를 위한 고성능 모델을 트레이닝, 미세조정, 배포하고자 하는 AI 연구자 및 개발자에게 적합합니다. 특히 코드 작성, 수학, 과학적 추론, 다중모달 인식(텍스트, 이미지, 비디오, 오디오)에 특화된 능력이 필요한 사용자에게 적합합니다.

주요 특징

  • 포괄적인 모델 레벨: 에지/PC용 Nano부터 데이터센터 규모의 Ultra까지, 550B-A55B Ultra 모델을 포함한 다양한 모델 제공.
  • 전 생애주기 도구: 데이터 커리레이션, 합성 데이터 생성(SDG), 벤치마크 평가를 커버하는 CLI 포함.
  • 다중모달 기능: Nano Omni 모델은 단일 디코더에서 텍스트, 이미지, 비디오, 오디오를 네이티브로 지원.
  • 고급 트레이닝 기법: Multi-Token Prediction (MTP), 비동기 GRPO, 최대 1M 토큰까지의 프로그레시브 컨텍스트 스케일링 구현.

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch