apple-aiml-research/ml-fastvit

This repository contains the official implementation of the research paper, "FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization" ICCV 2023

解決的問題

FastViT 設計用於建立高效率的視覺轉換器,使其在行動裝置上能實時運作,降低視覺轉換器(ViTs)通常伴隨的延遲,同時維持高準確度。

工作原理

採用混合架構,結合視覺轉換器與傳統卷積神經網路的優勢。核心機制為結構重參數化,使模型在訓練時具有複雜結構(未融合)以利更好學習,但在推論時則簡化為精簡、快速的版本(融合/重參數化)。

適用對象

本專案適用於在行動或邊緣裝置上開發電腦視覺應用的 AI 研究人員與開發者,這些場景對低延遲與高效率至關重要。

主要亮點

  • 行動優化:特別在 iPhone 12 Pro 上進行基準測試,確保真實行動環境下的效能表現。
  • 結構重參數化:支援從訓練時模型轉換至融合推論時模型,以提升速度。
  • 模型動物園:提供多種預訓練模型(T8 至 MA36),具有不同準確度與延遲的權衡。
  • 知識蒸餾:提供透過知識蒸餾訓練的模型,進一步提升 ImageNet-1K 上的 Top-1 準確率。
  • 跨平台匯出:包含將 PyTorch 檢查點匯出為 CoreML 的工具,便於在 Apple 裝置上部署。

相關

  • 專案
  • 專案
  • 專案
  • 專案