facebookresearch/pixio

[CVPR 2026] Pixio: a capable vision encoder dedicated to dense prediction, simply by pixel reconstruction

解決的問題

Pixio 提供一種專為密集預測任務(如單目深度估計、語義分割和 3D 重建)優化之視覺編碼器,這些任務對高解析度、像素級細節至關重要。它透過在預訓練階段專注於像素重建,克服一般性視覺編碼器的限制。

工作原理

基於遮罩自編碼器(MAE)架構,Pixio 引入三項主要演算法改進:更深的解碼器、更大的遮罩粒度以及增加的類別標記數量。此外,它以自整理的 MetaCLIP-2B 資料集版本取代標準的 ImageNet-1K 預訓練資料,以提升規模與品質。

適用對象

專為需要像素級精確預測而非簡單圖像級分類之電腦視覺任務的研究人員與開發者設計。

主要亮點

  • 卓越的密集預測表現:在單目深度估計與 3D 重建任務中,超越 MAE、DINOv2 與 DINOv3。
  • 強大的分割表現:在 ADE20K 與 Pascal VOC 等基準測試中達成競爭性或領先水準。
  • 可擴展架構:提供從 86M(Pixio-B)至 5.4B(Pixio-5B)參數的預訓練模型。
  • 靈活整合:相容原始原始碼與 Hugging Face Transformers API。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案