facebookresearch/pixio

[CVPR 2026] Pixio: a capable vision encoder dedicated to dense prediction, simply by pixel reconstruction

何を解決するか

Pixioは、単眼深度推定、セマンティックセグメンテーション、3D再構築など、高解像度のピクセル単位の詳細が不可欠な密な予測タスクに特化したビジョンエンコーダーを提供します。一般的なビジョンエンコーダーの限界を克服するために、事前学習段階でピクセル再構成に焦点を当てています。

仕組み

Masked Autoencoder (MAE)アーキテクチャを基盤とし、3つの主要なアルゴリズム的改善を導入しています:より深いデコーダー、より大きなマスキング粒度、および増加したクラストークン数。さらに、標準のImageNet-1K事前学習データの代わりに、メタCLIP-2Bデータセットの自己調整バージョンを使用することで、スケールと品質を向上させています。

対象ユーザー

ピクセル単位の正確な予測が必要なコンピュータビジョンタスクに取り組む研究者や開発者向けに設計されています。画像レベルの分類ではなく、密な予測を必要とする用途に最適です。

主な特徴

  • 優れた密な予測性能:単眼深度推定および3D再構築において、MAE、DINOv2、DINOv3を上回る結果を達成。
  • 強力なセグメンテーション性能:ADE20KやPascal VOCなどのベンチマークで競争力のある、あるいは最優秀の結果を実現。
  • スケーラブルなアーキテクチャ:86M(Pixio-B)から5.4B(Pixio-5B)までのパラメータ数の事前学習モデルを提供。
  • 柔軟な統合:オリジナルソースコードとHugging Face Transformers APIの両方に対応。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト