apple-aiml-research/ml-fastvit
This repository contains the official implementation of the research paper, "FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization" ICCV 2023
解決的問題
FastViT 設計用於建立高效率的視覺轉換器,使其在行動裝置上能實時運作,降低視覺轉換器(ViTs)通常伴隨的延遲,同時維持高準確度。
工作原理
採用混合架構,結合視覺轉換器與傳統卷積神經網路的優勢。核心機制為結構重參數化,使模型在訓練時具有複雜結構(未融合)以利更好學習,但在推論時則簡化為精簡、快速的版本(融合/重參數化)。
適用對象
本專案適用於在行動或邊緣裝置上開發電腦視覺應用的 AI 研究人員與開發者,這些場景對低延遲與高效率至關重要。
主要亮點
- 行動優化:特別在 iPhone 12 Pro 上進行基準測試,確保真實行動環境下的效能表現。
- 結構重參數化:支援從訓練時模型轉換至融合推論時模型,以提升速度。
- 模型動物園:提供多種預訓練模型(T8 至 MA36),具有不同準確度與延遲的權衡。
- 知識蒸餾:提供透過知識蒸餾訓練的模型,進一步提升 ImageNet-1K 上的 Top-1 準確率。
- 跨平台匯出:包含將 PyTorch 檢查點匯出為 CoreML 的工具,便於在 Apple 裝置上部署。
相關
- 專案
- 專案
- 專案
- 專案