BAIR PEVA:全身條件化自我中心視訊預測
BAIR 近期推出 Predicting Ego-centric Video from human Actions (PEVA),這是一個能在給定過去影格與期望的 3D 姿態變化下,預測下一個影格的模型。此模型將視訊預測與具體的、高維度的人類動作空間相結合,而非抽象的控制訊號,代表了為具身代理人打造世界模型的重要一步。
具身視訊預測的挑戰
自我中心視訊的預測本質上相當困難,因為動作與視覺高度依賴情境,且人類控制是高維的。BAIR 確認了四大主要障礙:
- 情境依賴性:相同的視角可能導致不同的移動,而相同的移動在不同環境下會產生不同的視覺結果。
- 高維控制:全身人體運動涉及超過 48 個自由度,且具備層次化、時間相關的動態特性。
- 隱藏的身體狀態:第一人稱視角揭示了代理人的目標,但常常隱藏執行動作的身體部位,模型必須從不可見的動作中推斷其後果。
- 時間延遲:視覺回饋往往落後於實際動作數秒,需要長時域的預測與時間推理能力。
PEVA 技術架構
PEVA 是一個自回歸條件擴散 Transformer,使用 Nymeria 大規模資料集進行訓練,該資料集將真實世界的自我中心視訊與身體姿態捕捉配對。
結構化動作表示
為了彌合動作與視覺之間的鴻溝,PEVA 以身體的運動學樹為基礎,將動作表示為高維向量。動作空間為 48 維,包含:
- 根節點平移:3 個自由度,負責全局平移。
- 上半身關節:15 個關節,每個關節有 3 個自由度(相對關節旋轉的歐拉角)。
所有運動皆從全局座標轉換至以骨盆為中心的局部座標系,以確保位置與方向的不變性。
條件擴散 Transformer(CDiT)增強
PEVA 在標準條件擴散 Transformer 基礎上做了三項具體擴充,以因應人體運動的複雜性:
- 隨機時間跳躍:讓模型同時學習即時的短期動態與較長期的活動模式。
- 序列層級訓練:模型在每個影格前綴上計算損失,以更好地模擬完整的運動序列。
- 動作嵌入:將時間 $t$ 的所有動作串接成一個 1D 張量,作為每個 AdaLN 層的條件,從而處理高維全身運動。
取樣與展開策略
推論時,PEVA 採用自回歸展開策略。它先透過 VAE 編碼器編碼上下文影格,接著加入當前動作,預測下一影格。預測得到的影格再加入上下文(同時移除最舊的影格),如此重複直至整個動作序列完成。為了提升速度,模型限制注意力範圍:影像注意力僅作用於目標影格,跨注意力僅作用於最後一個影格。
能力與應用
原子動作模擬
PEVA 能模擬「原子動作」的視覺結果,這些動作是指分解後的基本移動,例如左手或右手的上下左右移動,或全身的前進、左/右旋轉等。此功能展示了模型對關節層級動作如何轉換為自我中心視角變化的理解。
長時域生成
模型在較長時間內仍能保持視覺與語意的一致性,能夠在全身運動條件下生成連貫的 16 秒展開。
視覺規劃與反事實推論
PEVA 可用於規劃:透過模擬多個動作候選並以 LPIPS(Learned Perceptual Image Patch Similarity)為分數,找出最接近目標影像的序列。
規劃被表述為使用交叉熵方法(CEM)的能量最小化問題。例如,模型可以優化手臂的動作序列,使其觸及特定目標物件(如攪拌棒或水壺),儘管研究者指出目前仍缺乏雙臂協調的能力。
定量結果與擴展性
PEVA 在感知品質上持續優於基線,且在長時間範圍內保持一致性。研究者觀察到明顯的擴展性:模型規模越大,FID(Fréchet Inception Distance)等指標的表現皆會提升。
未來方向
雖然 PEVA 只是第一步,BAIR 仍指出多個未來發展領域:
- 閉環控制:從開環預測轉向可互動的環境。
- 目標條件化:整合明確的任務意圖或語意目標,而非僅依賴影像相似度作為代理。
- 以物件為中心的表示:加入聚焦於特定物件的表示,以提升交互的準確性。
SUMMARY: BAIR 引入 PEVA,一個為具身代理人設計的世界模型,能根據高維全身運動學姿態軌跡預測自我中心視訊影格。
TITLE: BAIR PEVA:全身條件化自我中心視訊預測