apple-aiml-research/ml-fastvlm
This repository contains the official implementation of "FastVLM: Efficient Vision Encoding for Vision Language Models" - CVPR 2025
何を解決するか
FastVLMは、高解像度画像を処理する際のビジョン言語モデル(VLM)における高い計算コストと遅延を解決します。特に、最初のトークンまでの時間(TTFT)を短縮し、視覚エンコーダーの全体的なサイズを小さくしつつ、精度を損なわないことを目指しています。
動作方法
本プロジェクトでは、FastViTHDと呼ばれるハイブリッドビジョンエンコーダーを導入しています。このエンコーダーは、画像の処理方法を最適化し、生成されるトークン数を削減します。エンコーディング段階で生成されるトークン数を減らすことで、初期応答時間(TTFT)が大幅に短縮され、従来のビジョンエンコーダーよりもメモリ使用量が少なくなります。
対象ユーザー
マルチモーダルAIアプリケーションを開発する研究者や開発者、特にモバイルデバイス(iOS)やApple Siliconハードウェアなどリソース制約のある環境をターゲットとする方々に最適です。
主な特徴
- 大幅な高速化: 最小のバリアントでは、LLaVA-OneVision-0.5Bと比較して85倍高速なTime-to-First-Token(TTFT)を達成しています。
- 効率性: 同程度の規模の競合モデルと比較して、視覚エンコーダーが3.4倍小さくなっています。
- 高いパフォーマンス: Qwen2-7Bを用いた大規模バリアントは、Cambrian-1-8Bを上回る性能を発揮しながらも、7.9倍のTTFTの高速化を維持しています。
- モバイル対応: 実機でのリアルタイムパフォーマンスを示すデモiOSアプリを含んでいます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト