facebookresearch/mae_st

Official Open Source code for "Masked Autoencoders As Spatiotemporal Learners"

何を解決するか

このプロジェクトは、時空間学習に適応されたマスク付き自己符号化器(MAE)のPyTorch実装を提供し、動画シーケンスの欠落部分を再構成することで、強力な動画表現を学習できるようにします。

動作方法

システムは、動画の大部分(デモでは最大98%)をマスクする戦略を使用します。その後、モデルは元の動画フレームを再構成するタスクに取り組み、フレーム間の空間的・時間的関係を学習してギャップを埋めるよう強制されます。

対象ユーザー

動画理解、自己教師付き学習、時空間モデルを必要とするコンピュータビジョンタスクに取り組む研究者や開発者向けです。

特徴

  • Kinetics-400、600、700データセット上でViT-LargeおよびViT-Hugeアーキテクチャの事前学習済みチェックポイントを提供。
  • 事前学習とファインチューニングの両方のワークフローをサポート。
  • モデルの再構成能力を視覚的に確認できるインタラクティブなデモ。
  • PyTorchおよびtimmライブラリを基盤として構築。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト