NVIDIA Nemotron 3 Nano Omni 發佈說明 / 新功能介紹

NVIDIA Nemotron 3 Nano Omni 發佈說明 / 新功能介紹

NVIDIA 推出了 Nemotron 3 Nano Omni,這是一款全模態(omni-modal)理解模型,專為現實世界的文檔分析、自動語音辨識 (ASR)、長音訊-影片理解、代理式電腦使用 (agentic computer use) 以及通用多模態推理而設計。該模型透過將文字、圖像、影片和音訊能力整合到單一系統中,並具備處理極長多模態上下文的能力,擴展了 Nemotron 多模態系列。

核心能力與應用場景

Nemotron 3 Nano Omni 針對五類主要的任務負載進行了優化:

  • 現實世界文檔分析: 該模型可處理 100 多頁的文檔,專注於複雜材料(如合約和技術論文)的佈局、表格、圖表、公式和跨頁引用。
  • 自動語音辨識 (ASR): 在多樣化的音訊條件下提供高品質的轉錄,包括具有不同口音和背景噪音的長音訊。
  • 長音訊-影片理解: 該模型能對混合的音訊和視覺證據進行共同推理,例如帶有旁白的螢幕錄影或會議存檔。
  • 代理式電腦使用: 專為 GUI 環境訓練,模型可以解讀螢幕截圖、監控 UI 狀態,並協助執行動作選擇和工作流自動化。
  • 通用多模態推理: 它能綜合長上下文窗口和多種模態的資訊,以執行多步驟推理和計算。

技術架構

Nemotron 3 Nano Omni 使用統一的 encoder-projector-decoder 設計。語言骨幹為 Nemotron 3 Nano 30B-A3B,並配備了 C-RADIOv4-H 視覺編碼器和 Parakeet-TDT-0.6B-v2 音訊編碼器。這些編碼器透過輕量級的 2 層 MLP projectors 與 LLM 骨幹連接。

Hybrid Mamba-Transformer-MoE 骨幹

為了在擴展至長多模態上下文時保持推理性能,該骨幹交錯使用了三個組件:

  • 23 個 Mamba selective state-space layers,用於高效的長上下文處理。
  • 23 個 MoE layers(128 個專家,top-6 路由,以及一個共享專家),用於條件容量。
  • 6 個 grouped-query attention layers,以保留全局交互和表達能力。

視覺與影片創新

  • 動態解析度: 該模型取代了分塊(tiling)技術,改用原生長寬比的動態解析度處理,每張圖像使用 1,024 到 13,312 個視覺 patches。這對於依賴 OCR 的文檔和 GUI 佈局至關重要。
  • Conv3D 時間壓縮: 對於影片,專用的 Conv3D tubelet embedding 路徑將連續的幀對融合為單個 tubelet,使語言模型需要關注的視覺 tokens 減半。
  • 高效影片採樣 (EVS): 這是一項推理時功能,在保持影片變化處的動態 tokens 的同時,捨棄冗餘的靜態影片 tokens,進一步降低延遲並提高吞吐量。

原生音訊整合

在 Parakeet-TDT-0.6B-v2 的驅動下,該模型處理採樣率為 16 kHz 的音訊。其訓練輸入長度可達 1,200 秒(20 分鐘),而 LLM 的最大上下文長度可支持超過 5 小時的音訊。音訊、視覺和文字 tokens 在共享的多模態序列中交錯並進行共同處理。

性能與基準測試

Nemotron 3 Nano Omni 展現出較 Nemotron Nano V2 VL 顯著的增長,並在多個領域超越了 Qwen3-Omni 30B-A3B:

任務 基準測試 Nemotron 3 Nano Omni Nemotron Nano V2 VL Qwen3-Omni 30B-A3B
文檔理解 OCRBenchV2-En 65.8 61.2 -
MMLongBench-Doc 57.5 38.0 49.5
CharXiv reasoning 63.6 41.3 61.1
GUI ScreenSpot-Pro 57.8 5.5 59.7
OSWorld 47.4 11.0 29.0
影片理解 Video-MME 72.2 63.0 70.5
影片 + 音訊理解 WorldSense 55.4 - 54.0
DailyOmni 74.1 - 73.6
語音互動 VoiceBench 89.4 - 88.8
ASR HF Open ASR 5.95 - 6.55

在效率方面,與其他具有相似互動性的開源全模態模型相比,Nemotron 3 Nano Omni 在多文檔使用場景下的系統效率提高了 7.4 倍,在影片使用場景下的系統效率提高了 9.2 倍。

訓練與數據基礎設施

訓練是在 NVIDIA H100 節點(規模從 32 到 128)上進行的,使用了 Megatron-LM、Transformer Engine 和 Megatron Energon。SFT 後的強化學習由 NeMo-RL 和 NeMo Gym 在 B200 和 H100 集群上處理。

強化學習 (RL)

  • Text RL: 評估模型執行工具調用、程式碼編寫和多部分規劃的能力。
  • Omni RL: 訓練模型跨圖像、影片、音訊和文字進行推理。驗證套件包含無法回答的案例,以教導模型在證據不足以防止幻覺時放棄回答。

合成數據生成

NVIDIA 使用 NeMo Data Designer 從現實世界的 PDF 中生成了約 1,140 萬個合成 QA 對(約 450 億個 tokens)以強化長上下文文檔推理,使 MMLongBench-Doc 的準確率提升了 2.19 倍。

可用性

權重檢查點(Checkpoints)已在 Hugging Face 上以 BF16、FP8 和 NVFP4 格式提供。技術報告可在 arXiv (2604.24954) 上查閱。

Sources