Qwen-RobotWorld: 面向具身代理的无限世界
Qwen-RobotWorld 是一个统一的世界模型,将自然语言视为通用动作接口,以弥合通用视频生成与特定领域具身模型之间的差距。通过将 20 多种机器人形态和 500 多个动作类别标准化为单一的语言驱动接口,模型实现了在操作、自动驾驶和室内导航等任务上的联合训练,使得一个领域的物理知识能够强化其他领域。
双流扩散架构
Qwen-RobotWorld 使用双流多模态扩散 Transformer (MMDiT) 将语义理解与视觉生成相结合。该架构由两个主要流组成:
- 理解流:处理来自冻结的 Qwen2.5-VL 编码器的语义特征,以表示语言动作 $a_t$。
- 生成流:处理来自视频兼容 VAE 的视觉潜在表示,以表示视觉状态 $s_t$。
这些流在每一层通过联合注意力进行交互,促进双向跨模态融合。通过使用完整的 MLLM(Qwen2.5-VL)作为动作编码器,而非 CLIP 或 T5 等轻量级编码器,模型能够对复杂指令实现更深层的语言理解,并利用内化的世界知识确保物理上合理的转变,例如保持机器人手臂的刚性。
跨形态与多视角生成
Scene2Robot 人体到机器人转移
Scene2Robot 机制通过将人类示范重新定向到 14 种不同的机器人形态,实现跨形态视频编辑。该机制采用多段条件化方式,联合注意力使模型能够同时关注场景外观和机器人运动轨迹。此能力既可作为训练数据扩展引擎,也可作为推理时的转移工具。
几何一致的多视角生成
为消除单摄像头视角常见的遮挡,Qwen-RobotWorld 生成 2–4 条同步的摄像头流(主视角、腕部视角和第三人称视角)。模型通过在训练期间空间拼接同步帧并使用非对称 3D RoPE 进行空间编码,在无需架构修改的情况下实现 3D 一致的物体身份和运动轨迹。这种多视角一致性充当几何正则化器,教会模型物体形状、深度和空间布局。
具身世界知识 (EWK) 数据集
模型在具身世界知识 (EWK) 数据集上进行训练,该数据集包含 860 万跨场景训练对,围绕四个维度组织:
- 多形态:覆盖 20 多种机器人模型,包括人手、7 种机器人臂配置、自车以及移动体。
- 多任务:包含 500 多个动作类别,涵盖原子级操作、长时程组合以及运动。
- 多场景:结合真实世界数据(厨房、车间、户外)与光真实感仿真。
- 多视角:约 160 万(在 600 万具身样本中)包含 2–4 视角拼接。
动作-语言映射
为解决表示异质性(例如操作中的关节角度与驾驶中的转向指令的差异),Qwen-RobotWorld 将所有动作信号投射到共享的自然语言空间。五层注释流水线确保精度:
- 任务目标:高级意图。
- 动作细节:时空轨迹和视角声明。
- 物理反馈:可观察的环境后果。
- 完整字幕:用于精确预测的完整描述。
- 简洁字幕:简短指令的关键要素。
训练课程
模型遵循从通用到专家的渐进式课程,在专注于具身物理之前构建基础先验:
| 阶段 | 数据混合 | 目标 |
|---|---|---|
| 预训练 | T2I / T2V / TI2V 联合 + 人类交互 (Ego4D, EPIC‑Kitchen) | 构建基础视觉先验和抓取/工具使用先验 |
| SFT 阶段 1 | 具身 + 通用联合训练 | 核心操作物理 |
| SFT 阶段 2 | 多视角扩展 | 扩大视角覆盖 |
| SFT 阶段 3 | 多视角拼接 | 跨视角几何一致性 |
| SFT 阶段 4 | 复杂跨域 | 长时程 & 跨场景泛化 |
性能与基准
Qwen-RobotWorld 在四项关键基准上均优于通用视频生成模型(如 Sora2、Veo3)和专用具身世界模型(如 Cosmos、LVP):
- EWMBench (4.60): 展示出强劲的运动保真度(HSD 0.566)和场景一致性(0.914)。
- DreamGen (4.952): 显示出强大的对象级组合泛化能力(GR1‑Object IF: 0.878)。
- WorldModelBench (8.99): 在牛顿定律、质量守恒、流体动力学和重力等方面实现了完美的物理遵循(1.00)。
- PBench (0.804): 展现出强大的领域理解(0.857)和运动平滑度(0.990)。
能力与泛化
模型展示了强大的零‑shot 能力和跨域泛化:
- 细粒度定位:根据指令中单关键词的变化生成不同的视频(例如 “Pick up the red strawberry” 与 “Pick up the yellow potato”)。
- 跨域迁移:能够从操作泛化到自动驾驶(使用 Bench2Drive、Waymo 等)和室内导航(使用 VLNVerse)。
- 长时程推理:处理复杂的多步骤指令,例如依次拾取多个物体并按特定顺序放置。