BAIR PEVA:全身条件付きエゴセントリックビデオ予測
BAIRはPredicting Ego-centric Video from human Actions (PEVA)(人間の行動からエゴセントリックビデオを予測する)を導入しました。このモデルは過去のフレームと望ましい3D姿勢の変化を入力として、次のビデオフレームを予測することができます。これは、抽象的な制御信号ではなく、物理的に根拠のある高次元の人間行動空間にビデオ予測を基づけることで、具現化エージェント向けのワールドモデルを構築する上で重要な一歩となります。
具現化ビデオ予測の課題
エゴセントリックビデオの予測は、行動と視覚が強く文脈依存であり、人間の制御が高次元であるため、本質的に困難です。BAIRは主に4つの課題を挙げています:
- 文脈依存性:同じ視覚的ビューでも環境により異なる動きが生じ、同じ動きでも環境次第で異なる視覚結果になる。
- 高次元制御:全身の人間の動きは48以上の自由度を持ち、階層的かつ時間依存のダイナミクスを伴う。
- 隠れた身体状態:第一人称視点はエージェントの目標を示すものの、動作を実行する身体が見えないことが多く、モデルは見えない行動から結果を推測する必要がある。
- 時間的遅延:視覚的フィードバックは物理的な行動より数秒遅れることが多く、長期予測と時間的推論が必要となる。
PEVA の技術アーキテクチャ
PEVAは自己回帰型条件付き拡散トランスフォーマーで、実世界のエゴセントリックビデオと身体姿勢キャプチャを組み合わせた大規模データセット Nymeria で学習されています。
構造化されたアクション表現
動作と視覚のギャップを埋めるため、PEVAは身体のキネマティックツリーに基づく高次元ベクトルとしてアクションを表現します。アクション空間は48次元で、以下で構成されます:
- ルート平行移動:全体の平行移動を表す3自由度。
- 上半身関節:15個の関節で、各関節は3自由度(相対関節回転のオイラー角)を持つ。
すべての動作は、位置と向きの不変性を保つために、グローバル座標系から骨盤中心のローカルフレームに変換されます。
条件付き拡散トランスフォーマー (CDiT) の拡張
PEVAは、人間の動作の複雑さに対処するため、標準的な Conditional Diffusion Transformer を以下の3つの点で拡張しています:
- ランダムタイムスキップ:モデルが即時の短期ダイナミクスと長期の活動パターンの両方を学習できるようにする。
- シーケンスレベルのトレーニング:各フレームのプレフィックスに対して損失を適用し、全体の動作シーケンスをより正確にシミュレートする。
- アクション埋め込み:時刻 $t$ のすべてのアクションを1次元テンソルに連結し、各 AdaLN 層に条件付けすることで、高次元の全身動作の処理を容易にする。
サンプリングとロールアウト戦略
推論時、PEVAは自己回帰的ロールアウト戦略を使用します。VAEエンコーダでコンテキストフレームをエンコードし、現在のアクションを付加して次のフレームを予測します。この予測フレームはコンテキストに追加され(最も古いフレームは除外され)、アクションシーケンスに対してこのプロセスが繰り返されます。速度最適化のため、モデルは注意機構を制限します:画像注意はターゲットフレームのみに適用され、コンテキストのクロス注意は最後のフレームのみに適用されます。
能力と応用
原子アクションシミュレーション
PEVAは「原子アクション」の視覚的結果をシミュレートできます。原子アクションとは、左手や右手の上下左右の動きや、全身の前進・左回転・右回転といった分解された動作です。これにより、特定の関節レベルの動きがエゴセントリック視点の変化にどのように対応するかをモデルが理解していることが示されます。
長期生成
モデルは長時間にわたり視覚的・意味的な一貫性を保ち、全身動作に条件付けされた一貫した16秒間のロールアウトを生成できます。
ビジュアルプランニングと反事実シミュレーション
PEVAは複数のアクション候補をシミュレートし、LPIPS(Learned Perceptual Image Patch Similarity)でスコアリングすることで、目標画像に最も近いシーケンスを見つけるプランニングに利用できます。
プランニングはクロスエントロピー法(CEM)を用いたエネルギー最小化問題として定式化されます。例えば、モデルは特定の腕が混合棒ややかんといった目標物体に到達するようにアクションシーケンスを最適化できますが、研究者は現在の制限として両腕間の協調動作が欠如していることを指摘しています。
定量的結果とスケーリング
PEVAは知覚品質においてベンチマークを一貫して上回り、長時間にわたる一貫性も維持します。研究者はスケーリング特性が強いことを観測し、モデルサイズが大きくなるほど、FID(Fréchet Inception Distance)を含む各指標で性能が向上することを確認しました。
今後の方向性
PEVAは初期段階の取り組みですが、BAIRは今後の開発に向けて以下の領域を指摘しています:
- 閉ループ制御:オープンループ予測からインタラクティブ環境への移行。
- 目標条件付け:画像類似性を代理指標とするのではなく、明示的なタスク意図や意味的目標を統合する。
- オブジェクト中心表現:特定のオブジェクトに焦点を当てた表現を取り入れ、相互作用の精度を向上させる。