제목: NVIDIA Nemotron 3 Nano Omni 릴리스 노트 / 새로운 기능

NVIDIA Nemotron 3 Nano Omni 릴리스 노트 / 새로운 기능

NVIDIA는 실세계 문서 분석, 자동 음성 인식(ASR), 긴 오디오-비디오 이해, 에이전틱 컴퓨터 사용, 그리고 일반적인 멀티모달 추론을 위해 설계된 옴니모달 이해 모델인 Nemotron 3 Nano Omni를 도입했습니다. 이 모델은 텍스트, 이미지, 비디오, 오디오 기능을 단일 시스템에 통합하여 매우 긴 멀티모달 컨텍스트를 처리할 수 있도록 Nemotron 멀티모달 라인을 확장합니다.

주요 기능 및 사용 사례

Nemotron 3 Nano Omni는 다섯 가지 주요 워크로드 클래스에 최적화되어 있습니다:

  • 실세계 문서 분석: 이 모델은 100+ 페이지 문서를 처리하며, 계약서와 기술 논문과 같은 복잡한 자료의 레이아웃, 테이블, 그림, 공식, 그리고 페이지 간 참조에 중점을 둡니다.
  • 자동 음성 인식(ASR): 다양한 오디오 조건에서 고품질 트랜스크립션을 제공하며, 다양한 악센트와 배경 소음이 있는 긴 형식의 오디오도 포함됩니다.
  • 긴 오디오-비디오 이해: 이 모델은 내레이션이 있는 화면 녹화나 회의 아카이브와 같은 혼합된 오디오 및 시각적 증거에 대해 공동으로 추론합니다.
  • 에이전틱 컴퓨터 사용: GUI 환경에 특화되어 훈련된 이 모델은 스크린샷을 해석하고, UI 상태를 모니터링하며, 행동 선택 및 워크플로 자동화를 돕습니다.
  • 일반적인 멀티모달 추론: 이 모델은 긴 컨텍스트 윈도우와 여러 모달에 걸친 정보를 종합하여 다단계 추론과 계산을 수행합니다.

기술 아키텍처

Nemotron 3 Nano Omni는 통합 인코더-프로젝터-디코더 설계를 사용합니다. 언어 백본은 Nemotron 3 Nano 30B-A3B이며, 이는 C-RADIOv4-H 비전 인코더와 Parakeet-TDT-0.6B-v2 오디오 인코더와 짝을 이룹니다. 이러한 인코더는 가벼운 2층 MLP 프로젝터를 통해 LLM 백본에 연결됩니다.

하이브리드 Mamba-Transformer-MoE 백본

긴 멀티모달 컨텍스트로 확장하면서 추론 성능을 유지하기 위해, 백본은 세 가지 구성 요소를 교차 배치합니다:

  • 23 Mamba 선택적 상태-공간 레이어 효율적인 장기 컨텍스트 처리를 위해.
  • 23 MoE 레이어 (128 전문가, 상위-6 라우팅, 및 공유 전문가) 조건부 용량을 위해.
  • 6 그룹드 쿼리 어텐션 레이어 전역 상호작용과 표현성을 유지하기 위해.

비전 및 비디오 혁신

  • 동적 해상도: 모델은 네이티브 종횡비에서의 동적 해상도 처리로 타일링을 대체하며, 이미지당 1,024에서 13,312개의 시각적 패치를 사용합니다. 이는 OCR이 많은 문서와 GUI 레이아웃에 중요합니다.
  • Conv3D 시간 압축: 비디오에 대해, 전용 Conv3D 튜블릿 임베딩 경로가 연속된 프레임 쌍을 singolo 튜블릿으로 융합하여 언어 모델이 주목해야 하는 비전 토큰을 절반으로 줄입니다.
  • 효율적인 비디오 샘플링(EVS): 이 추론 시간 기능은 동영상이 변경되는 부분의 동적 토큰을 유지하면서 중복된 정적 비디오 토큰을 제거하여 지연 시간을 더욱 줄이고 처리량을 향상시킵니다.

네이티브 오디오 통합

Parakeet-TDT-0.6B-v2로 구동되는 이 모델은 16 kHz에서 샘플링된 오디오를 처리합니다. 이 모델은 최대 1,200초(20분)까지의 입력을 훈련하며, LLM 최대 컨텍스트 길이는 5시간 이상의 오디오를 지원합니다. 오디오, 시각, 텍스트 토큰은 공유 멀티모달 시퀀스 내에서 교차되어 공동으로 처리됩니다.

성능 및 벤치마크

Nemotron 3 Nano Omni는 Nemotron Nano V2 VL에 비해 상당한 향상을 보이며, 여러 도메인에서 Qwen3-Omni 30B-A3B를 능가합니다:

작업 벤치마크 Nemotron 3 Nano Omni Nemotron Nano V2 VL Qwen3-Omni 30B-A3B
문서 이해 OCRBenchV2-En 65.8 61.2 -
MMLongBench-Doc 57.5 38.0 49.5
CharXiv reasoning 63.6 41.3 61.1
GUI ScreenSpot-Pro 57.8 5.5 59.7
OSWorld 47.4 11.0 29.0
비디오 이해 Video-MME 72.2 63.0 70.5
비디오 + 오디오 이해 WorldSense 55.4 - 54.0
DailyOmni 74.1 - 73.6
음성 상호작용 VoiceBench 89.4 - 88.8
ASR HF Open ASR 5.95 - 6.55

효율성 측면에서, Nemotron 3 Nano Omni는 유사한 상호작용을 가진 다른 오픈 옴니 모델에 비해 멀티 문서 사용 사례에서 시스템 효율성이 7.4배 높고, 비디오 사용 사례에서는 9.2배 높습니다.

훈련 및 데이터 인프라

훈련은 NVIDIA H100 노드(32에서 128로 확장)에서 Megatron-LM, Transformer Engine, 및 Megatron Energon을 사용하여 수행되었습니다. post-SFT 강화 학습은 B200 및 H100 클러스터에서 NeMo-RL 및 NeMo Gym이 처리했습니다.

강화 학습(RL)

  • 텍스트 RL: 도구 호출, 코드 작성, 그리고 다단계 계획 수행 능력을 평가합니다.
  • 옴니 RL: 이미지, 비디오, 오디오, 텍스트 전반에 걸쳐 추론하도록 모델을 훈련시킵니다. 검증자 스위트는 증거가 부족할 때 모델이 답변을 거부하도록 가르쳐 환각을 방지하는 답변할 수 없는 사례를 포함합니다.

합성 데이터 생성

NVIDIA는 NeMo Data Designer를 사용하여 실제 세계 PDF로부터 약 1,140만 개의 합성 QA 쌍(~450억 토큰)을 생성하여 장기 컨텍스트 문서 추론을 강화했으며, 이로 인해 MMLongBench-Doc 정확도가 2.19배 향상되었습니다.

가용성

체크포인트는 Hugging Face에서 BF16, FP8, NVFP4 형식으로 제공됩니다. 기술 보고서는 arXiv(2604.24954)에서 제공됩니다.

Sources