apple-aiml-research/ml-fastvit
This repository contains the official implementation of the research paper, "FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization" ICCV 2023
解决的问题
FastViT 旨在创建高性能的视觉 Transformer,使其在移动设备上能够实现实时使用,降低视觉 Transformer(ViTs)通常伴随的延迟,同时保持高精度。
工作原理
采用混合架构,结合了视觉 Transformer 和传统卷积神经网络的优势。核心机制是结构重参数化,使模型在训练时具有复杂的结构(未融合)以实现更好的学习,而在推理时则简化为精简、快速的版本(融合/重参数化)。
适用人群
本项目适用于在移动或边缘设备上开发计算机视觉应用的 AI 研究人员和开发者,这些场景对低延迟和高效率至关重要。
主要亮点
- 移动优化:专门在 iPhone 12 Pro 上进行基准测试,确保真实移动环境下的性能表现。
- 结构重参数化:支持从训练时模型到融合推理时模型的转换,以提升速度。
- 模型动物园:提供多种预训练模型(T8 到 MA36),具有不同的精度-延迟权衡。
- 知识蒸馏:提供通过知识蒸馏训练的模型,进一步提升 ImageNet-1K 上的 Top-1 准确率。
- 跨平台导出:包含将 PyTorch 检查点导出为 CoreML 的工具,便于在 Apple 设备上部署。
相关
- 项目
- 项目
- 项目
- 项目