Visual Salamandra 7B 릴리스

기술 아키텍처 및 비전-언어 정렬

Visual Salamandra는 late-fusion 아키텍처를 활용하여 시각 및 텍스트 모달리티 간의 격차를 메웁니다. 이 시스템은 Salamandra Instructed 7B 모델을 기반으로 하며 다음 구성 요소를 통합합니다:

  • Vision Encoder: Google의 SigLIP-So400m 인코더로, 384x384 해상도에서 14개의 패치로 이미지를 처리합니다.
  • Projector: 인코더의 이미지 임베딩을 LLM의 잠재 공간으로 매핑하는 맞춤형 2층 다층 퍼셉트론(MLP)입니다.
  • Backbone: Salamandra Instructed 7B 기본 모델입니다.

4단계 학습 프로세스

모델은 견고한 정렬 및 일반화를 보장하기 위해 구조화된 4단계 학습 파이프라인을 통해 개발되었습니다:

  1. Projector Pre-training: 초기 단계는 이미지 특징을 LLM의 잠재 공간에 맞추기 위해 MLP 프로젝터를 독점적으로 학습하는 데 초점을 맞춥니다.
  2. High-Quality Vision Pretraining: 인코더, 프로젝터, LLM이 재캡션된 이미지와 OCR 데이터를 포함한 정제된 데이터셋을 사용해 공동 학습을 진행합니다.
  3. Instruction Tuning: 모델은 광학 문자 인식(OCR) 및 시각적 질문 응답(VQA)과 같은 기반 비전 작업을 통해 사용자 지시를 따르도록 학습됩니다.
  4. Full Multimodal Tuning: 최종 단계는 텍스트 전용 예시, 단일 이미지, 다중 이미지 및 비디오 데이터를 포함시켜 실제 상황에 대한 일반화를 최적화합니다.

이 과정을 지원하기 위해 Lab은 610만 개의 instruction-tuning 인스턴스(그 중 842,000개는 텍스트 전용 샘플)를 사용했으며, LLaVA Next, Cambrian, AI2D와 같은 데이터셋을 활용해 수학적 추론, 문서 이해 및 시각적 그라운딩을 향상시켰습니다.

다국어 지원 및 유럽 언어 초점

Visual Salamandra는 언어적 다양성을 멀티모달 instruction‑tuned 프레임워크에 직접 통합합니다. 유럽 언어에 초점을 맞춤으로써, 모델은 멀티모달 AI 연구에서 과소대표되는 언어들의 자원 격차를 해소하고, 이러한 언어들이 지배적인 언어와 동일한 수준의 instruction 튜닝 및 비전‑작업 정렬 혜택을 누릴 수 있도록 합니다.

기능 및 적용 사례

Visual Salamandra는 다양한 입력으로부터 상황에 맞는 정확한 응답을 이해하고 생성할 수 있습니다. 주요 적용 분야는 다음과 같습니다:

  • Visual Question Answering (VQA): 이미지 또는 비디오에 대한 질문에 상황을 고려한 응답을 제공합니다.
  • Optical Character Recognition (OCR): 차트, 장면 및 문서에서 텍스트를 전사합니다.
  • Document and Chart Understanding: 그래픽 콘텐츠와 내장된 텍스트가 있는 복잡한 시각 문서를 분석합니다.
  • Mathematical Reasoning: 시각적으로 기반된 수학 문제를 해결합니다.
  • Instruction-based Image Interaction: 상세한 지시에 따라 위치 지정 작업 및 이미지 캡션을 수행합니다.
  • Video Analysis: 모델 아키텍처는 이벤트 감지, 멀티모달 스토리텔링 및 비디오 요약과 같은 향후 개발을 지원합니다.

제한 사항 및 윤리적 고려사항

그 능력에도 불구하고 Visual Salamandra는 알려진 제한 사항이 있습니다:

  • Hallucinations: 시각 입력이 모호할 경우 모델이 그럴듯하지만 잘못된 답변을 생성할 수 있습니다.
  • OCR Complexity: 밀집된 문서 레이아웃이나 매우 복잡한 OCR 작업을 처리할 때 성능이 여전히 어려움을 겪습니다.
  • Bias: 필터링되고 라이선스된 데이터셋으로 학습했음에도 모델이 편향이나 부정확성을 보일 수 있습니다.

Visual Salamandra는 연구 및 비상업적 사용을 위해 Apache License, Version 2.0 하에 공개됩니다.

Sources