NVIDIA Llama Nemotron Nano VL 發布

NVIDIA 宣佈發布 Llama Nemotron Nano VL,一款 8B 視覺語言模型(VLM),專為智慧文件處理(IDP)與光學字符辨識(OCR)而設計。該模型針對從複雜文件中提取與理解資訊進行了優化,涵蓋發票、收據、合約與財務報表等,現已於 Hugging Face Hub 上提供。

技術架構與創新

Llama Nemotron Nano VL 基於 Llama-3.1-8B-Instruct 語言模型與 C-RADIOv2-VLM-H Vision Transformer(ViT)構建。此組合使模型能處理各種視覺元素,包括圖表、圖形與複雜版面配置。

視覺基礎

C-RADIOv2-VLM-H ViT 作為視覺骨幹,實現文件的高解析度處理。主要創新包括:

  • 高解析度切片(High-Resolution Tiling):一種動態聚合編碼補丁特徵的設計,支援高解析度輸入,同時不犧牲空間連續性或計算效能。
  • 多解析度訓練(Multi-Resolution Training):C-RADIO 使用多種蒸餾技術與乘性噪聲,在多解析度資料上進行訓練,以提升泛化能力。
  • 長寬比彈性(Aspect Ratio Flexibility):模型能處理任意長寬比的文件,同時保留局部細節與全局語境,對於分析小字體與多欄版面尤為關鍵。

訓練方法論

模型經歷了兩階段的訓練流程:

  1. 預訓練(Pre-training):聚焦於使用 Multi-Layer Perceptron(MLP)連接器的語言與視覺領域跨模態對齊。此階段使用約 150 萬筆樣本的資料集,包含公開、合成與內部策劃的資料。
  2. 監督式微調(Supervised Fine-Tuning,SFT):模型在以 OCR 為中心的資料混合上進行端到端訓練,任務包括預測閱讀順序、重建 markdown 格式以及解析 LaTeX 數學公式。為確保魯棒性,NVIDIA 對文件影像施加了仿射與光度增強。

能力與效能

Llama Nemotron Nano VL 在視覺推理與文字辨識方面表現卓越,在 OCRBench v2 基準測試中展現業界領先的效能,同時在 ChartQA 與 AI2D 基準測試中亦取得優異成績。

主要功能能力

  • 文字與表格抽取:在文件中偵測與抽取文字與表格資料方面具備高精度。
  • 元素解析:能準確辨識關鍵元素,如表格、圖表與影像。
  • 定位(Grounding):支援在正規化空間(0-1000)內的邊界框座標,適用於查詢與輸出,實現文字參照與可解釋性。
  • 多模態輸出格式:可根據提示以 LaTeX、HTML 或 markdown 格式抽取表格。

企業應用案例

由於具備版面感知推理與單 GPU 高效能,該模型針對多領域的大規模企業自動化應用:

  • 金融與會計:自動從發票與收據中抽取項目與總額,以整合至 ERP 系統。
  • 法律與合規:審查合約關鍵條款,並分析身分證件(護照、身分證)以支援 KYC 流程。
  • 醫療保健:從醫療紀錄與保險表單中抽取患者資料與理賠資訊。

部署與客製化

Llama Nemotron Nano VL 可透過 NVIDIA NIM API 取得,亦可在 Hugging Face 下載。開發者可使用 NVIDIA NeMo 進一步進行後訓練或微調,以適應特定專有資料集。

Sources