facebookresearch/pixio
[CVPR 2026] Pixio: a capable vision encoder dedicated to dense prediction, simply by pixel reconstruction
解决的问题
Pixio 提供一种专为密集预测任务(如单目深度估计、语义分割和 3D 重建)优化的视觉编码器,这些任务对高分辨率、像素级细节至关重要。它通过在预训练阶段专注于像素重建,解决了通用视觉编码器的局限性。
工作原理
基于掩码自编码器(MAE)架构,Pixio 引入了三项主要算法改进:更深的解码器、更大的掩码粒度以及更多的类别令牌。此外,它用自整理的 MetaCLIP-2B 数据集版本替代了标准的 ImageNet-1K 预训练数据,以提升规模和质量。
适用人群
专为需要像素级精确预测而非简单图像级分类的计算机视觉任务的研究人员和开发者设计。
主要亮点
- 卓越的密集预测性能:在单目深度估计和 3D 重建任务中优于 MAE、DINOv2 和 DINOv3。
- 强大的分割性能:在 ADE20K 和 Pascal VOC 等基准测试中达到竞争性或领先水平。
- 可扩展架构:提供从 86M(Pixio-B)到 5.4B(Pixio-5B)参数的预训练模型。
- 灵活集成:兼容原始源代码和 Hugging Face Transformers API。
相关
- 项目
- 项目
- 项目
- 项目
- 项目