Hugging Face 비전 언어 모델 2025 업데이트

Vision Language Models (VLMs)은 단순한 이미지‑텍스트 시스템에서 복잡한 추론, any-to-any 모달리티 생성, 물리적 세계와의 상호작용이 가능한 다재다능한 멀티모달 에이전트로 진화했습니다. 현재 상황은 더 작고 효율적인 모델로의 전환, Mixture‑of‑Experts (MoE) 디코더의 통합, 그리고 멀티모달 RAG와 로봇 제어와 같은 특화된 기능의 등장으로 정의됩니다.

등장하는 모델 아키텍처 및 트렌드

최근 VLM 분야에서는 멀티모달 AI의 범위를 확장하는 여러 새로운 아키텍처 패러다임이 도입되었습니다.

Any-to-Any 모델

Any-to-any 모델은 이미지, 텍스트, 오디오 등 모든 입력 모달리티를 처리하고 모든 출력 모달리티를 생성할 수 있습니다. 이러한 모델은 여러 인코더를 사용해 임베딩을 공유 표현 공간으로 융합한 뒤, 원하는 모달리티로 디코딩합니다. 주요 예시로는:

  • Qwen 2.5 Omni: "Thinker‑Talker" 아키텍처를 활용해 "Thinker"가 텍스트를 처리하고 "Talker"가 스트리밍 자연스러운 음성을 생성합니다.
  • MiniCPM-o 2.6: 8B 파라미터 모델로 비전, 음성, 언어 전반에 걸친 이해와 생성이 가능합니다.
  • Janus-Pro-7B: 이해와 생성 과정을 분리하는 디커플드 비주얼 인코딩 아키텍처를 특징으로 합니다.
  • Chameleon (Meta): any-to-any 기능에 대한 초기 시도이며, 이후 Alpha‑VLLM의 Lumina-mGPT가 이미지 생성까지 확장했습니다.

멀티모달 추론 모델

추론 모델은 긴 chain‑of‑thought 처리를 통해 복잡한 문제를 해결하도록 설계되었습니다. Kimi-VL-A3B-Thinking은 MoonViT 이미지 인코더와 Mixture‑of‑Experts (MoE) 디코더(총 16B 파라미터, 활성 2.8B)를 활용한 대표적인 사례이며, Kimi‑VL 기본 모델을 장기 chain‑of‑thought 미세조정 및 강화학습 정렬한 버전입니다.

작고 효율적인 VLM

"Smol" 모델(보통 2B 파라미터 이하)로의 추세가 커지고 있어 연산 비용을 절감하고 소비자 디바이스에서 로컬 실행을 가능하게 합니다.

  • SmolVLM2: 256M, 500M, 2.2B 파라미터 규모에서 비디오 이해를 전담합니다.
  • Gemma 3-4B-it: 128k 토큰 컨텍스트 윈도우와 140개 이상의 언어 지원을 갖춘 가장 작은 멀티모달 모델 중 하나입니다.
  • Qwen2.5-VL-3B-Instruct: 32k 토큰 컨텍스트 길이로 로컬라이제이션, 문서 이해, 에이전시 작업을 수행합니다.

Mixture‑of‑Experts (MoE) 디코더

MoE 아키텍처는 표준 Feed‑Forward Network (FFN) 레이어를 라우터로 대체해 가장 관련성 높은 "전문가"만 선택적으로 활성화합니다. 이는 밀집 모델에 비해 추론 속도가 빠르고 학습 수렴이 빨라지는 장점이 있지만 GPU 메모리 요구량이 증가합니다. 예시로 Kimi-VL, MoE‑LLaVA, DeepSeek‑VL2, Llama 4 등이 있습니다.

Vision‑Language‑Action (VLA) 모델

VLA는 행동 및 상태 토큰을 추가해 VLM이 물리적 환경이나 디지털 UI를 제어할 수 있게 합니다.

  • π0 and π0‑FAST: 7개 플랫폼과 68개 작업(예: 세탁물 접기, 물체 회수)에서 훈련된 로봇 기반 모델입니다.
  • GR00T N1 (NVIDIA): 인간형 로봇을 위한 2B 기반 모델로 이미지와 언어를 실시간 움직임 제어로 변환합니다.

특수 멀티모달 기능

로컬라이제이션: 탐지, 세분화 및 카운팅

VLM은 이제 로컬라이제이션 토큰이 포함된 구조화된 텍스트를 출력함으로써 전통적인 컴퓨터 비전 작업을 일반화합니다.

  • PaliGemma and PaliGemma 2: 작업 프리픽스(예: "segment striped cat")를 사용해 바운딩 박스 좌표나 세분화 마스크용 코드북 인덱스를 출력합니다.
  • Molmo: 점으로 인스턴스를 가리키고 객체를 카운팅할 수 있습니다.
  • Qwen2.5‑VL: 탐지, 포인팅, 카운팅을 지원하며 UI 요소까지 포함합니다.

멀티모달 안전 모델

Jailbreak 및 유해 출력 방지를 위해 멀티모달 안전 모델은 입력과 출력을 모두 필터링합니다.

  • ShieldGemma 2: 특정 콘텐츠 정책에 따라 이미지를 평가하는 오픈 안전 모델입니다.
  • Llama Guard 4: Llama 4 Scout에서 프루닝된 밀집 멀티모달·다국어 안전 모델입니다.

멀티모달 검색 강화 생성 (RAG)

멀티모달 RAG는 취약한 PDF 파싱을 우회하고 스크린샷에서 직접 관련 페이지를 식별하는 멀티모달 리트리버를 사용합니다.

  • Document Screenshot Embedding (DSE): 텍스트와 이미지 인코더를 활용해 각 패시지당 단일 벡터를 반환합니다.
  • ColBERT‑like models (e.g., ColPali, ColQwen2): VLM을 이미지 인코더, LLM을 텍스트 인코더로 사용하고 "MaxSim"을 이용해 텍스트 토큰과 이미지 패치 간 유사도를 계산해 정밀도를 높입니다.

멀티모달 에이전트 및 비디오 이해

GUI 및 디지털 에이전트

VLM은 컴퓨터와 스마트폰 사용에 점점 더 많이 활용됩니다. UI‑TARS‑1.5(ByteDance)와 MAGMA‑8B는 UI 탐색 및 물리적 상호작용을 위해 설계되었습니다. Hugging Face의 smolagents 라이브러리는 이제 VLM 통합을 지원해 에이전트가 초기 이미지를 받거나 콜백을 통해 실시간으로 스크린샷을 동적으로 가져와 GUI를 제어할 수 있습니다.

비디오 언어 모델

비디오 이해는 프레임 시퀀스로 비디오를 처리하고 시간 관계를 관리하기 위한 다양한 전략을 사용합니다:

  • LongVU (Meta): DINOv2를 사용해 유사 프레임을 제거하고 텍스트 쿼리에 기반해 프레임 집합을 정제합니다.
  • Qwen2.5‑VL: 확장된 멀티모달 RoPE를 활용해 절대 시간 위치를 이해하고 동적 FPS 비율을 처리합니다.
  • Gemma 3: 텍스트 프롬프트에 타임스탬프와 교차된 비디오 프레임을 받아들입니다.

정렬 및 평가

선호도 최적화

Direct Preference Optimization (DPO)이 VLM에 적용돼 "chosen"와 "rejected" 답변 쌍을 이용해 모델 응답을 인간 선호도에 맞추고 있습니다. RLAIF‑V 데이터셋은 이를 위해 83,000개 이상의 주석 샘플을 제공하며, trl 라이브러리는 이 워크플로를 구현하기 위한 DPOTrainer를 제공합니다.

고급 벤치마크

모델이 기존 벤치마크에 포화됨에 따라 전문가 수준 지식·추론을 평가하기 위한 새로운 도구가 등장했습니다:

  • MMT‑Bench: 이미지·텍스트·비디오·포인트 클라우드 모달리티를 활용해 32개의 메타‑태스크(예: OCR, 시각 인식 등)에서 31,325개의 다중 선택 질문을 포함합니다.
  • MMMU‑Pro: 후보 옵션을 4개에서 10개로 확대하고 비전 전용 입력 및 실제 디스플레이 상황을 모방한 시뮬레이션을 포함해 MMMU를 발전시킨 버전입니다.

Sources