facebookresearch/mae_st

Official Open Source code for "Masked Autoencoders As Spatiotemporal Learners"

解决的问题

本项目提供了适用于时空学习的掩码自编码器(MAE)的 PyTorch 实现,使模型能够通过重建视频序列中的缺失部分,学习强大的视频表示。

工作原理

系统采用一种掩码策略,将视频的大部分(演示中高达 98%)进行掩码。随后,模型被要求重建原始视频帧,从而迫使它学习帧之间的空间和时间关系以填补空白。

适用人群

适用于从事视频理解、自监督学习以及需要预训练时空模型的计算机视觉任务的研究人员和开发者。

主要亮点

  • 提供在 Kinetics-400、600 和 700 数据集上针对 ViT-Large 和 ViT-Huge 架构的预训练检查点。
  • 支持预训练和微调工作流。
  • 提供交互式可视化演示,可查看模型的重建能力。
  • 基于 PyTorch 和 timm 库构建。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目