NVIDIA-NeMo/Automodel

🚀 Pytorch Distributed native training library for LLMs/VLMs with OOTB Hugging Face support

🚀 NeMo AutoModel – 개요

NeMo AutoModel(NVIDIA-NeMo 조직에서 호스팅)은 대규모 언어, 비전-언어, 확산 모델의 파인튜닝 또는 사전 학습을 가능한 한 적은 보일러플레이트 코드로 수행할 수 있게 해주는 Python 라이브러리입니다. PyTorch와 NVIDIA의 병렬 학습 스택(DTensor, 커스텀 커널, 텐서 병렬성, 파이프라인 병렬성 등) 위에 구축되어 있으며, Hugging Face에 있는 수십 개의 최첨단 모델에 대한 레시피가 제공됩니다.


핵심 아이디어

아이디어 사용자 관점에서의 의미
모델 비의존적 레시피 각 지원 모델(예: DeepSeek-V4.1-Flash, GLM-5.3, Qwen-3.8-Flash-Next, Nemotron-3-Ultra, Gemma-4 등)에는 데이터 로딩, 병렬성, 옵티마이저 및 특수 커널을 구성하는 YAML 정의 학습 스크립트가 있습니다. 레시피를 데이터로 지정하고 실행하기만 하면 됩니다.
풀 파라미터 및 LoRA/PEFT 지원 모델의 모든 가중치를 학습하거나 파라미터 효율적 파인튜닝(LoRA, PEFT)을 사용할 수 있습니다 – 동일한 인터페이스가 모두에 작동합니다.
추측 디코딩 & 드래프터 추측 디코딩을 통한 더 빠른 추론을 가능하게 하는 "드래프트" 모델(EAGLE, DFlash, DSpark) 학습에 대한 내장 지원.
에이전트 친화적 스킬 자동화 에이전트 또는 노트북에서 호출할 수 있는 작은 명령줄 "스킬" 컬렉션(예: run_recipe, model_onboard).
NVIDIA 최적화 커널 레시피는 H100/GB200 GPU에서 성능을 극대화하기 위해 커스텀 커널(예: CSA2, FlexAttention, TileLang, cuDNN DSA)을 자동으로 선택합니다.

수행할 수 있는 작업

  • LLM 파인튜닝(Dense, MoE, 하이브리드 어텐션)을 HellaSwag, MedPix 또는 사용자 정의 데이터셋과 같은 고전적 벤치마크에서 수행.
  • 비전-언어 모델 파인튜닝(LLaVA-OneVision, Qwen-VL, Inkling, MiniMax-M3)을 패킹 시퀀스 또는 멀티 토큰 예측 레시피로 수행.
  • 확산 또는 D-LLM 모델 학습(DiffusionGemma, DFlash) 및 추측 디코딩 실험.
  • 단일 GPU에서 수십 개의 H100/GB200 노드로 확장을 동일한 레시피를 사용하여 수행. 라이브러리가 내부에서 텐서 및 파이프라인 병렬성을 처리합니다.
  • 새 모델 추가는 짧은 모델 커버리지 MD 파일과 레시피를 작성하여 가능 – 저장소에는 이미 대규모 카탈로그가 포함되어 있습니다.

시작하기 (빠른 시작)

# 1. 설치 (Python 3.10+ 필요)
pip install nemo-automodel

# 2. 레시피 선택 – 예: HellaSwag에서 DeepSeek-V4.1-Flash 파인튜닝
python -m nemo_automodel.run \
    --recipe examples/llm_finetune/deepseek_v41/deepseek_v41_flash_hellaswag_ep64_16nodes.yaml \
    --data_path /path/to/hellaswag

YAML 파일에는 model, trainer, parallelism, dataset 섹션이 포함되어 있습니다. 데이터 파이프라인을 사용자 정의하지 않는 한 코드 변경이 필요하지 않습니다.


문서 & 리소스


누가 이걸 봐야 할까요?

  • 연구자: 최신 LLM/VLM 아키텍처에 대한 신뢰할 수 있고 고성능인 학습 파이프라인이 필요한 분.
  • 엔지니어: NVIDIA GPU에서 프로덕션 파인튜닝 서비스를 구축하는 분.
  • ML-ops 팀: 데이터 온보딩부터 멀티노드 학습까지 모든 것을 단일 저장소에서 처리하기를 원하는 팀.

라이선스

이 저장소는 Apache 2.0 라이선스(README의 배지 참조) 하에 공개됩니다.


요약

NeMo AutoModel은 NVIDIA의 턴키 라이브러리로, 풀 파라미터 및 파라미터 효율적 옵션을 모두 갖추고 있으며, 내장된 추측 디코딩 및 NVIDIA 최적화 커널 지원과 함께 대규모 현대 언어, 비전-언어, 확산 모델 카탈로그를 확장 가능하게 파인튜닝합니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트