apple-aiml-research/ml-fastvlm

This repository contains the official implementation of "FastVLM: Efficient Vision Encoding for Vision Language Models" - CVPR 2025

解决的问题

FastVLM 解决了视觉语言模型(VLM)在处理高分辨率图像时面临的高计算成本和延迟问题。其目标是减少首个 token 生成时间(TTFT),同时在不牺牲准确性的前提下缩小视觉编码器的整体规模。

工作原理

该项目引入了 FastViTHD,一种混合视觉编码器,通过优化图像处理方式来减少输出的 token 数量。通过在编码阶段减少生成的 token 数量,模型显著加快了初始响应时间(TTFT),并且比传统视觉编码器需要更少的内存。

适用人群

专为构建多模态 AI 应用的研究人员和开发者设计,尤其适用于资源受限的环境,如移动设备(iOS)或 Apple Silicon 硬件。

主要亮点

  • 显著提速:最小版本相比 LLaVA-OneVision-0.5B 实现了 85 倍的 Time-to-First-Token(TTFT)加速。
  • 高效性:视觉编码器体积比同类规模的竞品模型小 3.4 倍。
  • 高性能:使用 Qwen2-7B 的大版本在性能上超越 Cambrian-1-8B,同时保持 7.9 倍的 TTFT 加速。
  • 移动端就绪:包含一个演示 iOS 应用,展示在移动硬件上的实时性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目