facebookresearch/mae_st

Official Open Source code for "Masked Autoencoders As Spatiotemporal Learners"

解決的問題

本專案提供適用於時空學習的遮罩自編碼器(MAE)的 PyTorch 實作,讓模型能透過重建影片序列中的缺失部分,學習強大的影片表示。

工作原理

系統採用一種遮罩策略,將影片的大部分(示範中高達 98%)進行遮罩。隨後,模型被要求重建原始影片畫格,迫使它學習畫格之間的空間與時間關係以填補空白。

適用對象

適合從事影片理解、自監督學習以及需要預訓練時空模型的電腦視覺任務的研究人員與開發者。

主要特色

  • 提供在 Kinetics-400、600 和 700 資料集上針對 ViT-Large 與 ViT-Huge 架構的預訓練檢查點。
  • 支援預訓練與微調工作流程。
  • 提供互動式視覺化示範,可觀察模型的重建能力。
  • 建立於 PyTorch 與 timm 庫之上。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案