apple-aiml-research/ml-aim

This repository provides the code and model checkpoints for AIMv1 and AIMv2 research projects.

解决的问题

该项目提供了一组大规模视觉编码器,旨在通过自回归预训练克服传统视觉模型的局限性。其目标是构建高度可扩展且高效的视觉骨干网络,在无需复杂训练流程的情况下,于多模态理解、目标检测和图像识别任务中表现出色。

工作原理

AIM(自回归图像模型)采用多模态自回归目标进行预训练。最新版本 AIMv2 可在不同规模(参数量从 3 亿到 27 亿)和分辨率(224px 到 448px)之间有效扩展。支持 PyTorch、JAX 和 MLX(适用于 Apple Silicon)等多种后端。该架构支持冻结主干用于识别任务,并通过 2D 正弦位置嵌入实现原生分辨率处理。

适用人群

本项目适用于构建多模态应用、视觉-语言模型或高性能图像识别系统的 AI 研究人员和开发者,尤其适合需要强大预训练视觉骨干的场景。

主要亮点

  • 高性能:在大多数多模态基准测试中优于 OAI CLIP 和 SigLIP,在开放词汇目标检测中优于 DINOv2。
  • 可扩展架构:提供从 0.3B 到 2.7B 参数的多种模型。
  • 灵活部署:原生支持 PyTorch、JAX 和 MLX。
  • 分辨率无关性:包含可处理广泛图像分辨率和宽高比的特定检查点。
  • 蒸馏版本:提供针对多模态理解优化的蒸馏 ViT-Large 模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目