BAIR PEVA:全身条件化自我中心视频预测

BAIR 已经推出了 Predicting Ego-centric Video from human Actions (PEVA),这是一种能够在给定过去帧和期望的 3D 姿态变化的情况下预测下一帧视频的模型。这标志着在为具身代理创建世界模型方面迈出了重要一步,即通过将视频预测基于物理上有根基的、高维的人类动作空间,而不是抽象的控制信号。

具身视频预测的挑战

预测自我中心视频本质上非常困难,因为动作和视觉高度依赖上下文,并且人类控制是高维的。BAIR 确定了四个主要障碍:

  • 上下文依赖性:相同的视觉视角可能导致不同的运动,而相同的运动在不同环境下会产生不同的视觉结果。
  • 高维控制:全身人类运动涉及超过 48 个自由度,具有层次化、时间相关的动态特性。
  • 隐藏的身体状态:第一人称视角揭示了代理的目标,但往往隐藏了执行运动的身体,需要模型从不可见的动作中推断后果。
  • 时间滞后:视觉反馈通常比物理动作滞后数秒,需要进行长时程预测和时间推理。

PEVA 技术架构

PEVA 是一种自回归条件扩散 Transformer,使用 Nymeria 数据集进行训练——该数据集大规模配对了真实世界的自我中心视频与身体姿态捕捉。

结构化动作表示

为了弥合运动与视觉之间的鸿沟,PEVA 将动作表示为基于身体运动学树的高维向量。动作空间为 48 维,包含:

  • 根部平移:全局平移的 3 个自由度。
  • 上半身关节:15 个关节,每个关节有 3 个自由度(相对关节旋转的欧拉角)。

所有运动都从全局坐标转换为以骨盆为中心的局部坐标系,以确保位置和方向的不变性。

条件扩散 Transformer (CDiT) 增强

PEVA 在标准条件扩散 Transformer 的基础上做了三项特定扩展,以处理人类运动的复杂性:

  1. 随机时间跳跃:使模型能够学习即时的短期动力学以及更长期的活动模式。
  2. 序列级训练:模型在每个帧前缀上计算损失,以更好地模拟完整的运动序列。
  3. 动作嵌入:在时间 $t$ 的所有动作被拼接成一个 1D 张量,用于条件化每个 AdaLN 层,从而处理高维全身运动。

采样与展开策略

推理时,PEVA 采用自回归展开策略。它通过 VAE 编码器对上下文帧进行编码,附加当前动作,并预测下一帧。预测得到的帧随后加入上下文(最旧的帧被移除),该过程对动作序列重复进行。为提升速度,模型限制注意力范围:图像注意力仅作用于目标帧,上下文交叉注意力仅作用于最后一帧。

能力与应用

原子动作模拟

PEVA 能够模拟“原子动作”的视觉结果,这些动作是分解后的运动,例如移动左手或右手(上、下、左、右)或全身运动(前进、向左或向右旋转)。这展示了模型对特定关节级运动如何转化为自我中心视角变化的理解。

长时程生成

模型在较长时间段内保持视觉和语义的一致性,能够基于全身运动生成连贯的 16 秒展开。

视觉规划与反事实

PEVA 可用于规划,通过模拟多个动作候选并使用 LPIPS(Learned Perceptual Image Patch Similarity)对其进行评分,以找到最接近目标图像的序列。

规划被表述为使用交叉熵方法(CEM)的能量最小化问题。例如,模型可以优化特定手臂的动作序列,以触及目标物体(如搅拌棒或水壶),尽管研究者指出当前的局限在于两臂之间缺乏协同运动。

定量结果与扩展性

PEVA 在感知质量上始终优于基线,并在长时间范围内保持连贯性。研究者观察到强大的扩展特性,指出更大的模型规模在包括 FID(Fréchet Inception Distance)在内的各项指标上均有提升。

未来方向

虽然 PEVA 只是一个初步步骤,BAIR 仍指出了若干未来发展方向:

  • 闭环控制:从开环预测转向交互式环境。
  • 目标条件化:整合明确的任务意图或语义目标,而不是依赖图像相似性作为代理。
  • 面向对象的表示:引入关注特定对象的表示,以提升交互准确性。

Sources