apple-aiml-research/ml-aim

This repository provides the code and model checkpoints for AIMv1 and AIMv2 research projects.

해결하는 문제

이 프로젝트는 전통적인 비전 모델의 한계를 극복하기 위해 자기회귀적 사전 훈련을 사용하는 대규모 비전 인코더의 패밀리를 제공합니다. 복잡한 훈련 파이프라인 없이도 멀티모달 이해, 객체 탐지, 이미지 인식에서 뛰어난 성능을 발휘하는 매우 확장 가능하고 효과적인 비전 백본을 만드는 것을 목표로 합니다.

작동 방식

AIM(Autoregressive Image Models)은 멀티모달 자기회귀 목표를 사용하여 사전 훈련합니다. 최신 버전인 AIMv2는 3억에서 27억 파라미터, 224px에서 448px 해상도까지 다양한 규모에서 효과적으로 확장 가능합니다. PyTorch, JAX, MLX(애플 실리콘용) 등 여러 백엔드를 지원합니다. 아키텍처는 인식 작업에 사용 가능한 고정된 트렁크를 허용하며, 2D 사인 위치 임베딩을 통해 네이티브 해상도 처리를 지원합니다.

대상 사용자

이 프로젝트는 멀티모달 애플리케이션, 비전-언어 모델, 또는 고성능 이미지 인식 시스템을 구축하는 AI 연구자 및 개발자에게 적합합니다. 강력한 사전 훈련된 비전 백본이 필요한 경우에 최적입니다.

주요 특징

  • 고성능: 대부분의 멀티모달 벤치마크에서 OAI CLIP 및 SigLIP를 초월하며, 오픈 백터리 오브젝트 탐지에서는 DINOv2를 상회합니다.
  • 확장 가능한 아키텍처: 0.3B에서 2.7B 파라미터까지 다양한 모델을 제공합니다.
  • 유연한 배포: PyTorch, JAX, MLX에 대한 네이티브 지원을 제공합니다.
  • 해상도 독립성: 다양한 이미지 해상도와 종횡비를 처리할 수 있는 특정 체크포인트를 포함합니다.
  • 증류된 버전: 멀티모달 이해에 최적화된 증류된 ViT-Large 모델을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트