apple-aiml-research/ml-fastvlm

This repository contains the official implementation of "FastVLM: Efficient Vision Encoding for Vision Language Models" - CVPR 2025

何を解決するか

FastVLMは、高解像度画像を処理する際のビジョン言語モデル(VLM)における高い計算コストと遅延を解決します。特に、最初のトークンまでの時間(TTFT)を短縮し、視覚エンコーダーの全体的なサイズを小さくしつつ、精度を損なわないことを目指しています。

動作方法

本プロジェクトでは、FastViTHDと呼ばれるハイブリッドビジョンエンコーダーを導入しています。このエンコーダーは、画像の処理方法を最適化し、生成されるトークン数を削減します。エンコーディング段階で生成されるトークン数を減らすことで、初期応答時間(TTFT)が大幅に短縮され、従来のビジョンエンコーダーよりもメモリ使用量が少なくなります。

対象ユーザー

マルチモーダルAIアプリケーションを開発する研究者や開発者、特にモバイルデバイス(iOS)やApple Siliconハードウェアなどリソース制約のある環境をターゲットとする方々に最適です。

主な特徴

  • 大幅な高速化: 最小のバリアントでは、LLaVA-OneVision-0.5Bと比較して85倍高速なTime-to-First-Token(TTFT)を達成しています。
  • 効率性: 同程度の規模の競合モデルと比較して、視覚エンコーダーが3.4倍小さくなっています。
  • 高いパフォーマンス: Qwen2-7Bを用いた大規模バリアントは、Cambrian-1-8Bを上回る性能を発揮しながらも、7.9倍のTTFTの高速化を維持しています。
  • モバイル対応: 実機でのリアルタイムパフォーマンスを示すデモiOSアプリを含んでいます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト