apple-aiml-research/ml-aim

This repository provides the code and model checkpoints for AIMv1 and AIMv2 research projects.

何を解決するか

このプロジェクトは、従来のビジョンモデルの限界を克服するために自己回帰的プリトレーニングを使用する大規模なビジョンエンコーダーのファミリーを提供します。複雑なトレーニングパイプラインを必要とせずに、マルチモーダル理解、オブジェクト検出、画像認識において優れたパフォーマンスを発揮する、非常にスケーラブルで効果的なビジョンバックボーンの構築を目指しています。

動作方法

AIM(Autoregressive Image Models)は、マルチモーダル自己回帰的目標を用いたプリトレーニングに使用されます。最新バージョンであるAIMv2は、パラメータ数(3億~27億)と解像度(224px~448px)の異なる規模で効果的にスケーリング可能です。PyTorch、JAX、およびApple Silicon向けのMLXといった複数のバックエンドをサポートしています。アーキテクチャは、認識タスクに使用可能なフリーズされたトランクを可能にし、2D正弦波位置埋め込みを介してネイティブ解像度処理をサポートしています。

対象ユーザー

このプロジェクトは、マルチモーダルアプリケーション、ビジョン・ランゲージモデル、または高性能画像認識システムを構築するAI研究者や開発者向けです。強力な事前学習済みビジョンバックボーンを必要とする用途に最適です。

主な特徴

  • 高いパフォーマンス:ほとんどのマルチモーダルベンチマークでOAI CLIPやSigLIPを上回り、オープンボキャブラリオブジェクト検出ではDINOv2を上回ります。
  • スケーラブルなアーキテクチャ:0.3Bから2.7Bのパラメータを持つモデルを提供します。
  • 柔軟なデプロイ:PyTorch、JAX、MLXのネイティブサポートを備えています。
  • 解像度独立性:幅広い画像解像度とアスペクト比を処理可能な特定のチェックポイントを含みます。
  • 蒸留バージョン:マルチモーダル理解に最適化された蒸留済みViT-Largeモデルを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト