apple-aiml-research/ml-fastvit
This repository contains the official implementation of the research paper, "FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization" ICCV 2023
何を解決するか
FastViT は、モバイルデバイス上でリアルタイムに使用できるほど高速な高パフォーマンスなビジョントランスフォーマーを構築することを目的としています。ビジョントランスフォーマー(ViT)に通常伴う遅延を低減しつつ、高い精度を維持します。
動作方法
ハイブリッドアーキテクチャを採用しており、ビジョントランスフォーマーと従来の畳み込みニューラルネットワークの長所を組み合わせています。中心的なメカニズムは構造的再パラメータ化であり、学習時には複雑な構造(非融合)を持つことでより良い学習が可能ですが、推論時には簡素化された高速なバージョン(融合/再パラメータ化)に変換されます。
対象ユーザー
低遅延と高効率が重要なモバイルやエッジデバイス向けのコンピュータビジョンアプリケーションを開発するAI研究者や開発者向けです。
主な特徴
- モバイル最適化: 実際のモバイル環境でのパフォーマンスを保証するため、iPhone 12 Pro でベンチマークされています。
- 構造的再パラメータ化: 学習時のモデルから融合された推論時のモデルへの移行をサポートし、高速化を実現します。
- モデルズー: 異なる精度と遅延のトレードオフを持つ、T8 から MA36 までのさまざまな事前学習済みモデルを提供します。
- 知識蒸留: ImageNet-1K での Top-1 精度をさらに向上させるために、知識蒸留で訓練されたモデルも提供します。
- クロスプラットフォームエクスポート: PyTorch チェックポイントを CoreML にエクスポートするためのツールを含み、Apple デバイスへのデプロイを可能にします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト