NVIDIA Llama Nemotron Nano VL 출시

NVIDIA는 지능형 문서 처리(IDP)와 광학 문자 인식(OCR)을 위해 설계된 8B 비전 언어 모델(VLM)인 Llama Nemotron Nano VL의 출시를 발표했습니다. 이 모델은 청구서, 영수증, 계약서 및 재무제표와 같은 복잡한 문서에서 정보를 추출하고 이해하도록 최적화되었으며, 현재 Hugging Face Hub에서 이용할 수 있습니다.

기술 아키텍처 및 혁신

Llama Nemotron Nano VL은 Llama-3.1-8B-Instruct 언어 모델과 C-RADIOv2-VLM-H Vision Transformer(ViT)를 기반으로 구축되었습니다. 이 조합을 통해 모델은 차트, 그래프 및 복잡한 레이아웃을 포함한 다양한 시각 요소를 처리할 수 있습니다.

비전 기반

C-RADIOv2-VLM-H ViT는 비전 백본 역할을 하여 문서의 고해상도 처리를 가능하게 합니다. 주요 혁신 사항은 다음과 같습니다:

  • High-Resolution Tiling: 고해상도 입력을 지원하면서 공간 연속성이나 계산 효율성을 희생하지 않도록 인코딩된 패치 특징을 동적으로 집계하는 설계.
  • Multi-Resolution Training: C-RADIO는 일반화 향상을 위해 다중 증류 기법과 곱셈 노이즈를 사용하여 다중 해상도 데이터로 학습되었습니다.
  • Aspect Ratio Flexibility: 모델은 임의의 종횡비를 가진 문서를 처리하면서도 지역 세부 사항과 전역 컨텍스트를 유지할 수 있어 작은 글꼴 및 다중 열 레이아웃 분석에 중요합니다.

학습 방법론

모델은 두 단계의 학습 과정을 거쳤습니다:

  1. Pre-training: Multi-Layer Perceptron (MLP) 커넥터를 사용하여 언어와 비전 도메인 간의 교차 모달 정렬에 초점을 맞췄습니다. 이 단계에서는 공개, 합성 및 내부에서 선별한 데이터를 포함한 약 150만 개 샘플의 데이터셋을 활용했습니다.
  2. Supervised Fine-Tuning (SFT): 모델은 OCR에 초점을 맞춘 데이터 혼합을 사용해 엔드투엔드로 학습되었으며, 여기에는 읽기 순서 예측, markdown 형식 복원, LaTeX 수식 파싱과 같은 작업이 포함됩니다. 견고성을 확보하기 위해 NVIDIA는 문서 이미지에 어파인 및 광도 변형을 적용했습니다.

기능 및 성능

Llama Nemotron Nano VL은 시각적 추론 및 텍스트 인식에서 뛰어나며 OCRBench v2 벤치마크에서 업계 최고 수준의 성능을 보여줍니다. 또한 ChartQA와 AI2D 벤치마크에서도 강력한 결과를 달성했습니다.

주요 기능적 역량

  • Text and Table Extraction: 문서에서 텍스트와 표 데이터를 탐지하고 추출하는 데 높은 정확도를 보입니다.
  • Element Parsing: 표, 차트, 이미지와 같은 핵심 요소를 정확하게 식별합니다.
  • Grounding: 질의와 출력 모두에 대해 정규화된 공간(0-1000)에서 경계 상자 좌표를 지원하여 텍스트 참조 및 해석 가능성을 제공합니다.
  • Multimodal Output Formats: 프롬프트에 따라 LaTeX, HTML 또는 markdown 형식으로 표를 추출할 수 있습니다.

기업 활용 사례

레이아웃 인식 추론 및 단일 GPU에서의 효율성 덕분에, 이 모델은 여러 분야에서 대규모 기업 자동화를 목표로 합니다:

  • Finance and Accounting: 청구서 및 영수증에서 항목 및 총액을 자동으로 추출하여 ERP와 연동합니다.
  • Legal and Compliance: 계약서의 핵심 조항을 검토하고 신원 문서(여권, 신분증)를 분석하여 KYC 프로세스를 지원합니다.
  • Healthcare: 의료 기록 및 보험 양식에서 환자 데이터와 청구 정보를 추출합니다.

배포 및 맞춤화

Llama Nemotron Nano VL은 NVIDIA NIM API를 통해 제공되며 Hugging Face에서 다운로드할 수 있습니다. 개발자는 NVIDIA NeMo를 사용해 모델을 추가 학습하거나 미세 조정하여 특정 독점 데이터셋에 맞게 적용할 수 있습니다.

Sources