google-deepmind/representations4d
Foundation models for 4D spatial and temporal vision tasks.
해결하는 문제
이 저장소는 공간(3D)과 시간(1D) 차원을 통합적으로 다루는 4D 표현으로, AI 모델이 공간적·시간적 정보를 더 잘 이해할 수 있도록 설계된 고급 동영상 및 시각 표현의 모음입니다. 카메라 자세 추정, 객체 추적, 깊이 추정과 같은 비의미적 작업에 대한 자기지도 학습의 확장성 문제를 해결합니다.
작동 방식
이 프로젝트는 동영상 표현 학습을 위한 여러 가지 독특한 아키텍처 접근법을 구현합니다:
- 4D 표현의 확장성: 트랜스포머 기반 동영상 모델과 마스크된 자동인코딩(MAE)을 사용하여 공간적·시간적 작업의 성능을 확장합니다.
- Moving Off-the-Grid (MooG): 크로스 어텐션과 위치 임베딩을 활용해 잠재 토큰이 고정된 픽셀 그리드에 묶이지 않고 공간과 시간에 자유롭게 이동할 수 있도록 하여, 더 나은 객체 중심 추적을 가능하게 합니다.
- 재귀적 동영상 마스크 자동인코더(RVM): 비대칭 마스킹 목적과 픽셀 재구성 손실을 사용하는 재귀적 트랜스포머 기반 접근법으로, 동영상 표현 학습에서 높은 파라미터 효율성을 달성합니다.
- 오미보러스 비전 인코더: DINOv2와 같은 모델에 대해 사후 훈련 레시피를 제공하여, 동일한 장면의 다양한 감각적 시점(예: RGB와 깊이 맵) 간의 특징을 일치시킵니다.
- GenCeption: 사전 훈련된 동영상 생성 확산 백본(WAN 2.1)을 텍스트 지시에 따라 다양한 시각 작업을 수행할 수 있는 순방향 인식 모델로 변환합니다.
대상 사용자
컴퓨터 비전, 동영상 이해, 3D 장면 재구성 작업에 종사하는 연구자 및 개발자로서, 하류의 공간적·시간적 작업에 대해 고성능 자기지도 인코더와 백본이 필요한 분들입니다.
주요 특징
- 대규모 확장성: 자기지도 동영상 모델의 파라미터 수를 20M에서 22B까지 확장하는 것을 입증했습니다.
- 객체 중심 추적: MooG는 토큰이 픽셀이 아닌 의미 있는 객체에 바인딩되도록 합니다.
- 파라미터 효율성: 다른 모델과 비교해 증류 없이 최대 30배 더 높은 파라미터 효율성을 제공합니다.
- 일반화된 인식: GenCeption은 텍스트 프롬프트를 사용해 깊이, 표면 법선, 카메라 자세 추정을 하나의 모델로 처리할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트