apple-aiml-research/ml-fastvlm
This repository contains the official implementation of "FastVLM: Efficient Vision Encoding for Vision Language Models" - CVPR 2025
解決的問題
FastVLM 解決了視覺語言模型(VLM)在處理高解析度影像時所面臨的高計算成本與延遲問題。其目標是減少首個 token 生成時間(TTFT),同時在不犧牲準確性的前提下縮小視覺編碼器的整體規模。
工作原理
本專案引入 FastViTHD,一種混合式視覺編碼器,透過優化影像處理方式來減少輸出的 token 數量。透過在編碼階段減少生成的 token 數量,模型顯著加快了初始回應時間(TTFT),且比傳統視覺編碼器需要更少的記憶體。
適用對象
專為開發多模態 AI 應用的研究人員與開發者設計,特別適用於資源受限的環境,如行動裝置(iOS)或 Apple Silicon 硬體。
主要亮點
- 顯著提速:最小版本相比 LLaVA-OneVision-0.5B 實現 85 倍的 Time-to-First-Token(TTFT)加速。
- 高效性:視覺編碼器體積比同規模的競爭模型小 3.4 倍。
- 高性能量:使用 Qwen2-7B 的大版本在性能上超越 Cambrian-1-8B,同時保持 7.9 倍的 TTFT 加速。
- 行動端就緒:包含一個示範 iOS 應用,展示在行動硬體上的即時性能。
相關
- 專案
- 專案
- 專案
- 專案