facebookresearch/pixio

[CVPR 2026] Pixio: a capable vision encoder dedicated to dense prediction, simply by pixel reconstruction

해결하는 문제

Pixio는 단안 깊이 추정, 세분적 세그멘테이션, 3D 재구성과 같은 고해상도의 픽셀 단위 세부 정보가 중요한 밀집 예측 작업에 특화된 비전 인코더를 제공합니다. 일반적인 비전 인코더의 한계를 극복하기 위해 사전 훈련 단계에서 픽셀 재구성에 집중합니다.

작동 방식

Masked Autoencoder (MAE) 아키텍처를 기반으로 하며, 세 가지 주요 알고리즘적 개선을 도입합니다: 더 깊은 디코더, 더 큰 마스킹 세분화, 그리고 증가된 클래스 토큰 수. 또한 표준 ImageNet-1K 사전 훈련 데이터 대신 메타CLIP-2B 데이터셋의 자체 커스터마이징 버전을 사용하여 규모와 품질을 향상시킵니다.

대상 사용자

이미지 수준의 분류가 아니라 밀집된 픽셀 정확도 예측이 필요한 컴퓨터 비전 작업에 종사하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 우수한 밀집 예측 성능: 단안 깊이 추정 및 3D 재구성에서 MAE, DINOv2, DINOv3를 능가합니다.
  • 강력한 세그멘테이션 성능: ADE20K 및 Pascal VOC와 같은 벤치마크에서 경쟁력 있거나 최고 수준의 성능을 달성합니다.
  • 확장 가능한 아키텍처: 86M(Pixio-B)에서 5.4B(Pixio-5B)에 이르는 사전 훈련 모델을 제공합니다.
  • 유연한 통합: 원시 소스 코드와 Hugging Face Transformers API 모두 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트