apple-aiml-research/ml-fastvlm

This repository contains the official implementation of "FastVLM: Efficient Vision Encoding for Vision Language Models" - CVPR 2025

해결하는 문제

FastVLM은 고해상도 이미지를 처리할 때 비전 언어 모델(VLM)에서 발생하는 높은 계산 비용과 지연 문제를 해결합니다. 특히 처음 토큰이 생성되는 시간(TTFT)을 줄이고, 정확도를 희생하지 않으면서도 비전 인코더의 전체 크기를 줄이는 것을 목표로 합니다.

작동 방식

이 프로젝트는 FastViTHD라는 하이브리드 비전 인코더를 도입합니다. 이 인코더는 이미지 처리 방식을 최적화하여 생성되는 토큰 수를 줄입니다. 인코딩 단계에서 생성되는 토큰 수를 줄임으로써 모델은 초기 응답 시간(TTFT)을 크게 단축하고, 기존 비전 인코더보다 메모리 사용량도 줄일 수 있습니다.

대상 사용자

다중 모달 AI 애플리케이션을 개발하는 연구자 및 개발자, 특히 모바일 장치(iOS) 또는 Apple Silicon 하드웨어와 같은 자원 제약 환경을 타겟으로 하는 사용자에게 적합합니다.

주요 특징

  • 매우 빠른 속도: 가장 작은 버전은 LLaVA-OneVision-0.5B보다 85배 빠른 Time-to-First-Token(TTFT)을 달성합니다.
  • 효율성: 유사한 규모의 경쟁 모델과 비교해 비전 인코더 크기가 3.4배 작습니다.
  • 높은 성능: Qwen2-7B를 사용한 대규모 버전은 Cambrian-1-8B를 능가하면서도 7.9배 빠른 TTFT를 유지합니다.
  • 모바일 대응: 모바일 하드웨어에서 실시간 성능을 보여주는 데모 iOS 앱이 포함되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트