google-deepmind/representations4d
Foundation models for 4D spatial and temporal vision tasks.
解決的問題
本倉儲提供一系列先進的視覺與影片表示方法,旨在提升AI模型對空間(3D)與時間(1D)維度的理解能力——統稱為4D表示。它解決了在相機位姿估計、物件追蹤與深度估計等非語意任務中,自監督學習的可擴展性挑戰。
如何運作
本專案實作了多種不同的影片表示學習架構方法:
- 擴展4D表示:使用基於Transformer的影片模型與遮罩自編碼(MAE)結合,提升空間-時間任務的效能。
- 離格移動(MooG):採用交叉注意力與位置嵌入,使潛在權杖可在空間與時間中自由移動,而非被固定在像素網格上,從而實現更佳的物件中心追蹤。
- 遞迴影片遮罩自編碼器(RVM):一種基於遞迴Transformer的方法,採用非對稱遮罩目標與像素重建損失,實現影片表示學習中的高參數效率。
- 全知視覺編碼器:為DINOv2等模型提供一種後訓練配方,用於對齊同一場景的不同感官視圖(如RGB與深度圖)之間的特徵。
- GenCeption:將預訓練的影片生成擴散骨幹(WAN 2.1)轉換為前饋感知模型,透過文字指令執行多種視覺任務。
適用對象
適用於從事電腦視覺、影片理解及3D場景重構的研究人員與開發者,他們需要高效率、自監督的編碼器與骨幹網路,用於下游的空間-時間任務。
主要亮點
- 大規模擴展:展示自監督影片模型從20M到22B參數的擴展能力。
- 物件中心追蹤:MooG允許權杖綁定至有意義的物件,而非像素。
- 參數效率高:RVM在不使用蒸餾的情況下,相比其他模型參數效率最高可達30倍。
- 通用感知能力:GenCeption使單一模型可透過文字提示處理深度、表面法線與相機位姿估計。
相關
- 專案
- 專案
- 專案
- 專案