facebookresearch/mae_st

Official Open Source code for "Masked Autoencoders As Spatiotemporal Learners"

해결하는 문제

이 프로젝트는 시공간 학습에 적합하게 조정된 마스크된 자동부호화기(MAE)의 PyTorch 구현을 제공하여, 동영상 시퀀스의 누락된 부분을 재구성함으로써 강력한 동영상 표현을 학습할 수 있도록 합니다.

작동 방식

시스템은 동영상의 대다수(데모에서는 최대 98%)를 마스크하는 전략을 사용합니다. 이후 모델은 원래 동영상 프레임을 재구성하는 작업을 수행하게 되며, 이는 프레임 간의 공간적·시간적 관계를 학습하여 갭을 채우도록 강제합니다.

대상 사용자

동영상 이해, 자기지도 학습, 사전 훈련된 시공간 모델이 필요한 컴퓨터 비전 작업에 종사하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • Kinetics-400, 600, 700 데이터셋에서 ViT-Large 및 ViT-Huge 아키텍처용 사전 훈련된 체크포인트 제공.
  • 사전 훈련 및 피니튜닝 워크플로우 모두 지원.
  • 모델의 재구성 능력을 시각화할 수 있는 인터랙티브 데모 제공.
  • PyTorch 및 timm 라이브러리를 기반으로 구축.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트