NVIDIA-NeMo/Automodel
🚀 Pytorch Distributed native training library for LLMs/VLMs with OOTB Hugging Face support
🚀 NeMo AutoModel – 개요
NeMo AutoModel(NVIDIA-NeMo 조직에서 호스팅)은 대규모 언어, 비전-언어, 확산 모델의 파인튜닝 또는 사전 학습을 가능한 한 적은 보일러플레이트 코드로 수행할 수 있게 해주는 Python 라이브러리입니다. PyTorch와 NVIDIA의 병렬 학습 스택(DTensor, 커스텀 커널, 텐서 병렬성, 파이프라인 병렬성 등) 위에 구축되어 있으며, Hugging Face에 있는 수십 개의 최첨단 모델에 대한 레시피가 제공됩니다.
핵심 아이디어
| 아이디어 | 사용자 관점에서의 의미 |
|---|---|
| 모델 비의존적 레시피 | 각 지원 모델(예: DeepSeek-V4.1-Flash, GLM-5.3, Qwen-3.8-Flash-Next, Nemotron-3-Ultra, Gemma-4 등)에는 데이터 로딩, 병렬성, 옵티마이저 및 특수 커널을 구성하는 YAML 정의 학습 스크립트가 있습니다. 레시피를 데이터로 지정하고 실행하기만 하면 됩니다. |
| 풀 파라미터 및 LoRA/PEFT 지원 | 모델의 모든 가중치를 학습하거나 파라미터 효율적 파인튜닝(LoRA, PEFT)을 사용할 수 있습니다 – 동일한 인터페이스가 모두에 작동합니다. |
| 추측 디코딩 & 드래프터 | 추측 디코딩을 통한 더 빠른 추론을 가능하게 하는 "드래프트" 모델(EAGLE, DFlash, DSpark) 학습에 대한 내장 지원. |
| 에이전트 친화적 스킬 | 자동화 에이전트 또는 노트북에서 호출할 수 있는 작은 명령줄 "스킬" 컬렉션(예: run_recipe, model_onboard). |
| NVIDIA 최적화 커널 | 레시피는 H100/GB200 GPU에서 성능을 극대화하기 위해 커스텀 커널(예: CSA2, FlexAttention, TileLang, cuDNN DSA)을 자동으로 선택합니다. |
수행할 수 있는 작업
- LLM 파인튜닝(Dense, MoE, 하이브리드 어텐션)을 HellaSwag, MedPix 또는 사용자 정의 데이터셋과 같은 고전적 벤치마크에서 수행.
- 비전-언어 모델 파인튜닝(LLaVA-OneVision, Qwen-VL, Inkling, MiniMax-M3)을 패킹 시퀀스 또는 멀티 토큰 예측 레시피로 수행.
- 확산 또는 D-LLM 모델 학습(DiffusionGemma, DFlash) 및 추측 디코딩 실험.
- 단일 GPU에서 수십 개의 H100/GB200 노드로 확장을 동일한 레시피를 사용하여 수행. 라이브러리가 내부에서 텐서 및 파이프라인 병렬성을 처리합니다.
- 새 모델 추가는 짧은 모델 커버리지 MD 파일과 레시피를 작성하여 가능 – 저장소에는 이미 대규모 카탈로그가 포함되어 있습니다.
시작하기 (빠른 시작)
# 1. 설치 (Python 3.10+ 필요)
pip install nemo-automodel
# 2. 레시피 선택 – 예: HellaSwag에서 DeepSeek-V4.1-Flash 파인튜닝
python -m nemo_automodel.run \
--recipe examples/llm_finetune/deepseek_v41/deepseek_v41_flash_hellaswag_ep64_16nodes.yaml \
--data_path /path/to/hellaswag
YAML 파일에는 model, trainer, parallelism, dataset 섹션이 포함되어 있습니다. 데이터 파이프라인을 사용자 정의하지 않는 한 코드 변경이 필요하지 않습니다.
문서 & 리소스
- 전체 문서: https://docs.nvidia.com/nemo/automodel/latest/index.html
- 모델 커버리지 목록: https://docs.nvidia.com/nemo/automodel/latest/model-coverage/overview.html (지원되는 모든 모델 및 그 기능을 표시)
- 성능 요약: https://docs.nvidia.com/nemo/automodel/latest/performance-summary.html
- 예제 폴더: https://github.com/NVIDIA-NeMo/Automodel/tree/main/examples (LLM, VLM, 확산, 추측 디코딩 등 레시피)
- 기여 가이드: https://github.com/NVIDIA-NeMo/Automodel/blob/main/CONTRIBUTING.md
누가 이걸 봐야 할까요?
- 연구자: 최신 LLM/VLM 아키텍처에 대한 신뢰할 수 있고 고성능인 학습 파이프라인이 필요한 분.
- 엔지니어: NVIDIA GPU에서 프로덕션 파인튜닝 서비스를 구축하는 분.
- ML-ops 팀: 데이터 온보딩부터 멀티노드 학습까지 모든 것을 단일 저장소에서 처리하기를 원하는 팀.
라이선스
이 저장소는 Apache 2.0 라이선스(README의 배지 참조) 하에 공개됩니다.
요약
NeMo AutoModel은 NVIDIA의 턴키 라이브러리로, 풀 파라미터 및 파라미터 효율적 옵션을 모두 갖추고 있으며, 내장된 추측 디코딩 및 NVIDIA 최적화 커널 지원과 함께 대규모 현대 언어, 비전-언어, 확산 모델 카탈로그를 확장 가능하게 파인튜닝합니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트