Qwen-RobotWorld: 具現化エージェントのための無限の世界

Qwen-RobotWorld は、自然言語を汎用的なアクションインターフェースとして扱い、汎用ビデオ生成とドメイン固有の具現化モデル間のギャップを埋める統合世界モデルです。20 以上のロボットエンボディメントと 500 以上のアクションカテゴリを単一の言語駆動インターフェースに標準化することで、操作、自律走行、室内ナビゲーションを横断した共同トレーニングが可能となり、あるドメインの物理的知識が他のドメインを強化します。

デュアルストリーム拡散アーキテクチャ

Qwen-RobotWorld は、マルチモーダル拡散トランスフォーマー (MMDiT) のデュアルストリーム構造を利用して、意味的理解と視覚生成を統合します。アーキテクチャは主に二つのストリームから構成されます:

  • Understanding Stream: 冷凍された Qwen2.5-VL エンコーダから意味的特徴を処理し、言語アクション $a_t$ を表現します。
  • Generation Stream: ビデオ対応 VAE からの視覚潜在表現を処理し、視覚状態 $s_t$ を表現します。

これらのストリームは各層で共同注意を介して相互作用し、双方向のクロスモーダル融合を促進します。軽量エンコーダ(CLIP や T5 など)ではなく、フル MLLM(Qwen2.5-VL)をアクションエンコーダとして使用することで、複雑な指示に対する深い言語理解を実現し、内部化された世界知識を活用してロボットアームの剛性維持など物理的に妥当な遷移を保証します。

クロスエンボディメントとマルチビュー生成

Scene2Robot ヒューマンからロボットへの転送

Scene2Robot メカニズムは、人間のデモンストレーションを 14 種類のロボット形態にリターゲットすることで、クロスエンボディメント動画編集を可能にします。これは、シーンの外観とロボットの動作軌跡に同時に注意を向けることができるマルチセグメント条件付け機構を通じて実現されます。この機能は、トレーニングデータのスケーリングエンジンであると同時に、推論時の転送ツールとしても機能します。

幾何学的に一貫したマルチビュー生成

単一カメラビューでよく発生する遮蔽を排除するため、Qwen-RobotWorld は 2〜4 本の同期カメラストリーム(メインビュー、手首装着ビュー、第三者ビュー)を生成します。空間的に同期フレームを結合してトレーニングし、非対称 3D RoPE を空間エンコーディングに使用することで、アーキテクチャの変更なしに 3D 一貫したオブジェクトの同一性と動作軌跡を実現します。このマルチビュー一貫性は、オブジェクト形状、深度、空間配置をモデルに学習させる幾何学的正則化として機能します。

具現化世界知識 (EWK) データセット

モデルは Embodied World Knowledge (EWK) データセットでトレーニングされます。このデータセットは、4 つの軸にわたって構成された 8.6M のクロスシナリオ学習ペアを含みます:

  • Multi-Embodiment: 20 以上のロボットモデルをカバーし、人間の手、7 種類のロボットアーム構成、エゴ車両、モバイルエージェントを含みます。
  • Multi-Task: 500 以上のアクションカテゴリを含み、原子操作、長時間ホライズンの合成、移動を網羅します。
  • Multi-Scenario: 現実世界データ(キッチン、作業場、屋外)とフォトリアリスティックシミュレーションを組み合わせます。
  • Multi-View: 6M の具現化サンプルのうち約 1.6M が 2〜4 ビューの結合を含みます。

アクション-言語マッピング

表現の異質性(例:操作における関節角度と走行におけるステアリング指令の違い)を解決するため、Qwen-RobotWorld はすべてのアクション信号を共有自然言語空間に投影します。5 層のアノテーションパイプラインが精度を保証します:

  1. Task Goal: 高レベルの意図。
  2. Action Detail: 時空間的軌跡と視点宣言。
  3. Physical Feedback: 環境に観測可能な結果。
  4. Comprehensive Caption: 正確な予測のための完全な記述。
  5. Concise Caption: 簡潔なコマンドに必要な要素。

トレーニングカリキュラム

モデルは、基礎的な事前知識を構築した後に具現化物理に特化する、一般から専門への段階的カリキュラムに従います:

フェーズ データミックス 目的
Pretraining T2I / T2V / TI2V joint + Human interaction (Ego4D, EPIC-Kitchen) 基礎的な視覚事前知識と把握/ツール使用の事前知識を構築
SFT Phase 1 Embodied + general joint training コア操作物理
SFT Phase 2 Multi-view expansion 視点カバレッジの拡大
SFT Phase 3 Multi-view concatenation クロスビュー幾何学的一貫性
SFT Phase 4 Complex cross-domain 長時間ホライズンとクロスシナリオの汎化

パフォーマンスとベンチマーク

Qwen-RobotWorld は、一般的なビデオ生成モデル(例:Sora2、Veo3)および専門的な具現化世界モデル(例:Cosmos、LVP)を四つの主要ベンチマークで上回ります:

  • EWMBench (4.60): 高い動き忠実度 (HSD 0.566) とシーン一貫性 (0.914) を示す。
  • DreamGen (4.952): オブジェクトレベルの構成汎化が強い (GR1-Object IF: 0.878)。
  • WorldModelBench (8.99): ニュートンの法則、質量保存、流体力学、重力に対し、物理遵守が完璧 (1.00)。
  • PBench (0.804): ドメイン理解 (0.857) と動きの滑らかさ (0.990) が高い。

能力と汎化

モデルは、ゼロショット能力とクロスドメイン汎化を示します:

  • Fine-Grained Grounding: 指示中の単一キーワードの変更(例:「赤いイチゴを拾う」 vs. 「黄色いジャガイモを拾う」)だけで異なる動画を生成。
  • Cross-Domain Mobility: 操作以外にも自律走行(Bench2Drive、Waymo など)や室内ナビゲーション(VLNVerse)へ汎化。
  • Long-Horizon Reasoning: 複数のオブジェクトを順に拾い、特定の順序で配置するなど、複雑な多段階指示に対応。

Sources