apple-aiml-research/ml-aim
This repository provides the code and model checkpoints for AIMv1 and AIMv2 research projects.
解決的問題
本專案提供一組大規模視覺編碼器,旨在透過自回歸預訓練克服傳統視覺模型的限制。其目標是建立高度可擴展且高效的視覺骨幹,無需複雜的訓練流程,即可在多模態理解、物件檢測與影像辨識任務中表現出色。
工作原理
AIM(自回歸影像模型)採用多模態自回歸目標進行預訓練。最新版本 AIMv2 可在不同規模(參數量從 3 億到 27 億)與解析度(224px 到 448px)之間有效擴展。支援 PyTorch、JAX 與 MLX(適用於 Apple Silicon)等多種後端。該架構支援凍結主幹用於辨識任務,並透過 2D 正弦位置嵌入實現原生解析度處理。
適用對象
本專案適用於建構多模態應用、視覺-語言模型或高效率影像辨識系統的 AI 研究人員與開發者,特別適合需要強大預訓練視覺骨幹的場景。
主要亮點
- 高性能量:在大多數多模態基準測試中優於 OAI CLIP 與 SigLIP,在開放詞彙物件檢測中優於 DINOv2。
- 可擴展架構:提供從 0.3B 到 2.7B 參數的多種模型。
- 靈活部署:原生支援 PyTorch、JAX 與 MLX。
- 解析度無關性:包含可處理廣泛影像解析度與長寬比的特定檢查點。
- 蒸餾版本:提供針對多模態理解優化的蒸餾 ViT-Large 模型。
相關
- 專案
- 專案
- 專案
- 專案